Dr. Annia ABTOUT, Dr. Julien DELAUNAY
Introduction
Imaginez un collaborateur capable de lire l’intégralité du Code civil en quelques secondes, de synthétiser dix ans de jurisprudence avant votre réunion de 9h et de rédiger une première analyse contractuelle sans pause-café. C’est pourtant la promesse des LegalTech à l’ère de l’IA, un marché évalué à 1,45 milliard de dollars en 2024 selon Grand View Research [1], avec une trajectoire à 17 % de croissance annuelle projetée jusqu’en 2030. Cet enthousiasme est largement alimenté par les démonstrations techniques : en 2023, GPT-4 qui réussit l’examen du barreau américain au 90e percentile [2], surpassant la majorité des candidats humains, un résultat que nous n’aurions pu imaginer un an auparavant.
Pour autant, ce collaborateur prodige a un problème majeur : il n’est pas des plus fiables. Ainsi, avec aplomb, il cite des arrêts inexistants, attribue des positions à des juridictions qui ne les ont jamais prises, et acquiesce poliment quand vous lui soumettez une hypothèse fausse, plutôt que de la corriger. Ce biais, documenté sous le terme de sycophanie, transforme l’outil en chambre d’écho des erreurs de l’utilisateur. Or, en droit, ce type de défaillance a de véritables conséquences juridiques.
Aujourd’hui, l’IA juridique se situe entre performances académiques notables et fragilité factuelle rédhibitoire. Comprendre cet écart, c’est comprendre pourquoi le déploiement en conditions réelles reste un chantier et quelles architectures techniques permettent d’y répondre sérieusement.
Le piège des fictions juridiques
Les grands modèles de langage (LLM) fonctionnent sur un principe probabiliste, ils prédisent le token le plus vraisemblable à chaque étape de génération, en s’appuyant sur les schémas statistiques absorbés lors de l’entraînement. Ce mécanisme produit des textes fluides et cohérents en apparence mais il ne permet pas de garantie de vérité factuelle. Or, en droit, cette limite prend une dimension critique.
Par exemple, une étude de Dahl et al. (2024) [3] montre que GPT-4 hallucine dans au moins 58 % des cas lorsqu’il est interrogé sur la jurisprudence américaine. Plus spécifiquement, les erreurs ne sont pas uniformément réparties, elles se concentrent plutôt sur les juridictions de rang inférieur, les affaires anciennes ou très récentes, et les précédents peu médiatisés. Autrement dit, précisément là où la vérification humaine est la plus coûteuse en temps. Ils se sont également intéressés à la taxonomie des défaillances et ont distingué deux grandes catégories : les hallucinations en domaine fermé, où le modèle contredit le document qu’on lui a lui-même fourni ; et les hallucinations en domaine ouvert, où il invente des faits absents des corpus connu [4]. Dans les deux cas, la réponse produite est souvent convaincante en surface car rédigée avec un ton juridique crédible et fluide alors qu’il n’y a pas de fondement juridique pour la soutenir.
La taxonomie des défaillances des LLM dans le domaine juridique comprend également le biais de sycophanie [5]. Ainsi, lorsqu’un utilisateur formule une hypothèse incorrecte dans sa question, par exemple, en affirmant qu’un arrêt a été infirmé alors qu’il ne l’a pas été, le modèle tend à valider cette prémisse plutôt qu’à la corriger. Ce biais amplifie l’erreur au lieu de la détecter et constitue un risque juridique et réputationnel pour les professionnels du droit, au même titre que les hallucinations.
Le RAG : quand l’IA apprend à citer ses sources
Face à ce constat, la réponse a été structurelle : plutôt que de tenter d’améliorer la mémoire interne du modèle, les chercheurs ont voulu ancrer ses réponses dans des sources externes vérifiables. C’est le principe de la Génération Augmentée par Récupération (RAG).
Concrètement, avant de produire une réponse, le système effectue une recherche dans une base documentaire (textes de loi, articles de code, décisions de jurisprudence) et sélectionne les passages les plus pertinents pour la question posée. Ces extraits sont ensuite injectés dans le contexte du modèle, qui est invité à synthétiser à partir de ces sources, et non de sa mémoire statistique. On passe ainsi du « générateur qui devine » au « synthétiseur qui cite », permettant au passage la traçabilité des affirmations, chacune pouvant être rattachée à une source précise.
Mais l’implémentation révèle une complexité que la description schématique masque : la qualité d’un système RAG dépend moins du modèle générateur que de la précision du module de récupération (retriever). Plusieurs paramètres critiques entrent en jeu.
Le premier est le découpage des textes. Les recherches récentes, notamment celles portées par le benchmark LegalBench-RAG [6], montrent que les stratégies de découpage récursif, qui respectent les frontières naturelles des paragraphes et des phrases, surpassent les méthodes naïves par fenêtres de taille fixe. La raison est intuitive : un article de loi tronqué au milieu d’une condition peut complètement inverser son sens juridique. Récupérer un fragment mal délimité, c’est transmettre au modèle une information structurellement corrompue.
Le deuxième paradoxe est celui du contexte long. On pourrait croire qu’injecter davantage de documents améliore la réponse. C’est l’inverse : des contextes trop longs augmentent le risque que le modèle oublie ou hallucine des informations situées au milieu du texte, un phénomène documenté sous le nom de lost in the middle. La récupération de snippets minimaux mais hautement pertinents est préférable à une injection massive.
Le troisième enjeu est celui du dialogue multi-tours. Dans une consultation juridique réelle, les questions s’enchaînent et se précisent progressivement. Les systèmes RAG doivent alors gérer la résolution d’anaphores (comprendre à quoi renvoie cet article ou cette procédure dans le fil de la conversation, aussi connue sous le nom de résolution de coréférences) et filtrer le bruit accumulé des échanges précédents. Les recherches menées sur LexRAG [7] montrent que même avec les meilleures stratégies de reformulation de requêtes, le taux de rappel plafonne souvent autour de 33 % dans des scénarios de consultation complexes. La similarité sémantique seule ne suffit pas à capturer l’intention juridique implicite d’un non-expert.
Généraliste ou spécialiste : qui gagne vraiment ?
Si l’intuition suggère que des modèles entraînés spécifiquement sur des corpus juridiques devraient surpasser des généralistes, la réalité des benchmarks raconte une histoire plus nuancée.
Les évaluations menées via LawBench [8] et LexEval [9], deux référentiels apparus respectivement à EMNLP et NeurIPS 2024, classent les tâches selon une hiérarchie cognitive inspirée de la taxonomie de Bloom : mémorisation d’articles, compréhension de textes, inférence logique, discrimination entre cas similaires, génération de documents, et enfin éthique. Ce cadre révèle un paradoxe de la spécialisation : les modèles fine-tunés sur des données juridiques verticales régressent souvent en capacité de raisonnement général, ils excellent dans la récitation pure d’articles mais échouent dès que la tâche exige une inférence logique ou une application contextuelle. Le fine-tuning semble donc éroder ce que le modèle de base avait acquis en termes de flexibilité.
Face à eux, des modèles généralistes massifs (GPT-4, Qwen-72B) augmentés par RAG reprennent l’avantage dès que la complexité de la tâche dépasse la pure récitation. Leur capacité de raisonnement général, préservée, s’applique à un contexte vérifié fourni par le retriever.
La piste la plus prometteuse semble être hybride, incarnée notamment par le framework BLADE [10] dans lequel un LLM généraliste boîte noire assure le raisonnement de haut niveau, tandis qu’un petit modèle de moins de 3 milliards de paramètres, entraîné sur le domaine juridique, fournit une connaissance spécialisée via des interactions fines au niveau des représentations internes. On conserve les capacités de raisonnement du généraliste sans les coûts prohibitifs d’un fine-tuning complet, le tout sans sacrifier la confidentialité des données, puisque l’expertise reste localisée dans le petit modèle.
Graph RAG : quand la loi devient un graphe de connaissances
Le RAG, aussi bien conçu soit-il, bute sur une limite structurelle : il traite le corpus juridique comme une collection de documents, alors que le droit est fondamentalement structuré selon une hiérarchie (titres, chapitres, sections, articles), traversée par une dimension temporelle dense (amendements successifs, abrogations partielles, renvois croisés entre codes). Un LLM qui ignore cette structure peut citer un article abrogé depuis trois ans avec la même assurance qu’un texte en vigueur, et rien dans sa réponse ne le signalera.
Les architectures Graph RAG répondent à ce défi en changeant radicalement la représentation du corpus. L’idée centrale est de modéliser l’ensemble des textes juridiques non plus comme une base documentaire, mais comme un graphe de connaissances : un réseau structuré où chaque nœud représente un élément normatif (un article, une disposition, une version d’un texte), et chaque lien encode une relation sémantique précise (relation de hiérarchie, de modification, d’abrogation, de renvoi entre articles). La navigation dans ce graphe est déterministe : on ne cherche plus un passage « sémantiquement proche » d’une requête, on reconstruit le chemin normatif exact qui répond à la question.
L’architecture la plus avancée dans cette direction est le Structure-Aware Temporal Graph RAG (SAT-Graph RAG) [11]. Sa valeur ajoutée repose sur deux dimensions. La première est structurelle : en s’appuyant sur des ontologies formelles comme LRMoo [12], le système modélise la hiérarchie intrinsèque de la loi comme base structurelle du graphe, ce qui permet une reconstruction fidèle et auditable de tout texte. La seconde est temporelle : chaque acte législatif (amendement, abrogation, entrée en vigueur) est réifié comme un nœud d’action dans le graphe, avec ses intervalles de validité explicitement encodés. Le système peut ainsi retrouver l’état exact d’un texte à une date précise, répondant directement au problème d’anachronisme des LLM classiques.
On bascule d’une IA probabiliste, qui génère ce qui ressemble à la loi, pour se rapprocher d’une IA déterministe, qui reconstruit la loi à partir d’une structure faisant autorité. La traçabilité devient totale, la citation devient auditée.
Le coût de cette précision est réel. Ces architectures exigent une curation de données rigoureuse, une gouvernance stricte des métadonnées, et des ressources d’ingénierie importantes. Une erreur dans les intervalles de validité d’un nœud se propage silencieusement à tous les résultats qui en dépendent. Et surtout, elles soulèvent une question politique autant que technique : seules les juridictions disposant de données structurées de qualité (et des moyens pour les maintenir) pourront en bénéficier. Le risque est de creuser un nouveau fossé de la justice, où les ordres juridiques les mieux dotés accèdent à une IA déterministe et fiable, pendant que les autres restent exposés aux limites du RAG standard.
Conclusion
L’IA juridique est déjà une réalité opérationnelle. Sur des tâches bien délimitées telles que la revue documentaire, une première analyse contractuelle, la veille réglementaire ou encore la recherche jurisprudentielle, elle délivre des gains de productivité mesurables et commence à redéfinir les standards d’efficacité des acteurs juridiques. La question n’est donc plus de savoir si l’on peut l’utiliser mais à quelles conditions le faire sans compromettre la fiabilité que le droit exige.
Ces conditions sont d’ordre architectural autant qu’organisationnel. Un RAG bien conçu constitue le socle minimal pour toute application en contexte professionnel. Pour les corpus normatifs complexes, évolutifs et hiérarchisés, le Graph RAG apporte une couche de déterminisme pertinente. Enfin, pour les tâches de raisonnement avancé, les architectures hybrides généraliste-expert offrent le meilleur compromis entre profondeur domaine et capacité d’inférence. Cependant, la supervision humaine n’est pas un filet de sécurité provisoire en attendant que les modèles progressent mais une exigence structurelle face à la nature probabiliste de l’IA générative.
Cette maturité technique croissante arrive par ailleurs dans un contexte réglementaire qui se structure rapidement. L’AI Act européen, entré en vigueur en 2024 et dont les obligations s’appliquent progressivement jusqu’en 2027, classe explicitement certains usages de l’IA dans le domaine judiciaire parmi les systèmes à haut risque qui sont soumis à des exigences strictes de transparence, de traçabilité et de supervision humaine. Pour les acteurs du secteur juridique, ce cadre est une feuille de route qui converge précisément avec les bonnes pratiques techniques décrites dans cet article. Ainsi, concevoir des systèmes d’IA juridique robustes et conformes, c’est désormais la même chose.
Références
[1] https://www.grandviewresearch.com/industry-analysis/legal-ai-market-report
[3] M. Dahl, V. Magesh, M. Suzgun, et D. E. Ho, « Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models », J. Leg. Anal., vol. 16, no 1, p. 64‑93, janv. 2024, doi: 10.1093/jla/laae003.
[4] « [2306.09525] Explaining Legal Concepts with Augmented Large Language Models (GPT-4) ». Consulté le: 31 mars 2026. [En ligne]. Disponible sur: https://arxiv.org/abs/2306.09525
[5] F. Keisha et al., « All for law and law for all: Adaptive RAG Pipeline for Legal Research », 10 septembre 2025, arXiv: arXiv:2508.13107. doi: 10.48550/arXiv.2508.13107.
[6] N. Pipitone et G. H. Alami, « LegalBench-RAG: A Benchmark for Retrieval-Augmented Generation in the Legal Domain », 19 août 2024, arXiv: arXiv:2408.10343. doi: 10.48550/arXiv.2408.10343.
[7] H. Li et al., « LexRAG: Benchmarking Retrieval-Augmented Generation in Multi-Turn Legal Consultation Conversation », in Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval, in SIGIR ’25. New York, NY, USA: Association for Computing Machinery, juill. 2025, p. 3606‑3615. doi: 10.1145/3726302.3730340.
[8] Z. Fei et al., « LawBench: Benchmarking Legal Knowledge of Large Language Models », in Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, Y. Al-Onaizan, M. Bansal, et Y.-N. Chen, Éd., Miami, Florida, USA: Association for Computational Linguistics, nov. 2024, p. 7933‑7962. doi: 10.18653/v1/2024.emnlp-main.452.
[9] H. Li, Y. Chen, Q. Ai, Y. Wu, R. Zhang, et Y. Liu, « LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models », Adv. Neural Inf. Process. Syst., vol. 37, p. 25061‑25094, déc. 2024, doi: 10.52202/079017-0790.
[10] « BLADE: Enhancing Black-Box Large Language Models with Small Domain-Specific Models | Proceedings of the AAAI Conference on Artificial Intelligence ». Consulté le: 31 mars 2026. [En ligne]. Disponible sur: https://ojs.aaai.org/index.php/AAAI/article/view/34620
[11] H. de Martim, « An Ontology-Driven Graph RAG for Legal Norms: A Structural, Temporal, and Deterministic Approach », 11 septembre 2025, arXiv: arXiv:2505.00039. doi: 10.48550/arXiv.2505.00039.