Actualités

LegalTech¹, LLM², RAG³, 43 ans de recherche et d’innovations

pour, autour de l’IA, intelligence artificielle, pour proposer une nouvelle manière d’accéder à l’intelligence accumulée par les hommes sur les métiers du bien loger.

« Dès ma folle jeunesse, j’ai joué de tous les instruments. »
Pierre-Augustin Caron de Beaumarchais.

Arrivé à un âge où l’on peut se poser, regarder le chemin parcouru et tracer avec sérénité la suite du parcours, j’ai pu faire le constat que pendant plus de 40 ans, le numérique, l’immobilier, le juridique et plus originalement, l’Intelligence Artificielle n’avaient cessé de construire mon expertise.

Il y a 43 ans, sur un campus de province…

L’histoire débute sur le campus de l’université de droit de Rouen Mont-Saint-Aignan en 1983, par l’introduction de 2 enseignements dans notre licence, l’informatique du droit et le droit de l’informatique.

La première matière était assurée par une jeune notaire timide, mais qui réussit un véritable cours d’histoire ou plutôt de la préhistoire française de la LegalTech. Le cœur de son cours était le récit de l’aventure notariale SYDONI, pour Système de documentation notariale informatique. Elle constitue effectivement l’un des épisodes importants et aujourd’hui assez oubliés de la volonté de travailler avec du code informatique à l’intérieur du langage humain.

Dès ces années 1983-1985, je me suis familiarisé avec plusieurs idées que l’on redécouvre aujourd’hui avec le RAG et les LLM : texte intégral, recherche documentaire, langage naturel, systèmes experts et hypertexte.

Le deuxième cours, sur le droit de l’informatique, était assuré par le jeune et flamboyant professeur Jérôme Huet, qui poussa une partie de la promo à rejoindre l’IRETIJ – Institut de recherche et d’études pour le traitement de l’information juridique (créé à la faculté de droit de Montpellier en 1968, sous l’impulsion du professeur Pierre Catala⁴ ).

C’est un point historique assez remarquable : les juristes français commencent à travailler sur la recherche informatisée avant même la création d’Internet, du micro-ordinateur et du Minitel. Je fus de ceux-là, et ce flash-back estival me renvoie une certaine fierté ! Les travaux ultérieurs de Montpellier porteront sur le raisonnement juridique, les systèmes experts et la représentation informatique de la norme.

professeur Huet

Les fondations françaises de la quatrième révolution industrielle centrée sur l'intelligence artificielle et le numérique interconnecté

Le cas SYDONI = Système de documentation notariale informatique.

Le système fut développé dès les années 1970 dans l’environnement des CRIDON, notamment celui de Lyon. La documentation notariale était déjà systématiquement collectée depuis les années 1960 ; l’idée fut d’en faire une véritable banque documentaire informatisée.
Le système permettait le stockage et la recherche de documents juridiques provenant de sources multiples : revues juridiques, lois, décrets, circulaires, jurisprudence et réponses ministérielles.

C’est donc assez proche conceptuellement d’un premier data lake juridique documentaire spécialisé. Et SYDONI n’était pas un simple fichier bibliographique : une étude historique décrit la base comme intégrant textes officiels + jurisprudence + doctrine, développée à l’initiative du notariat via les CRIDON et avec un financement de la Caisse des dépôts.
La première informatique juridique française fut principalement fondée sur la recherche documentaire : index, mots-clés, abstracts, texte intégral, opérateurs booléens.

Puis apparaît une seconde approche : plutôt que demander à l’utilisateur de connaître la structure de la base, on cherche à reproduire les associations entre concepts juridiques.
C’est précisément là que l’hypertexte devint particulièrement adapté au droit : une disposition renvoie à une autre disposition, une décision à un texte, une doctrine à une jurisprudence, une définition à un concept, etc.
C’est une transition intellectuelle importante :

 ▢ Base documentaire → texte intégral → liens entre documents → hypertexte → systèmes experts.

Et aujourd’hui :

 ▢ Corpus documentaire → embeddings → recherche sémantique → RAG → LLM.

La continuité historique est assez spectaculaire.
En réalisant ce début d’année 2026 notre nouvelle plateforme d’agents métiers IA sécurisant la stratégie patrimoniale de mes clients HLM, j’ai pu mesurer à la fois la durée de maturation dans une société des technologies nouvelles, mais aussi la force de l’inéluctable développement de l’humanité augmentée.

Logo logiciel de recouvrement Themis

1993 Thémis, Formidable pionnier

Si pour Beaumarchais, en France tout finit par des chansons, pour une entreprise disruptive, il faut au commencement des rencontres humaines.

Thémis, plateforme industrielle de gestion des retards de paiement pour les grandes entreprises et du contentieux juridique afférent, fut la rencontre à travers mes missions de consulting sur ces processus métier, d’un jeune développeur de chez Wang⁵, d’un expert très expérimenté, (il fut l’un des premiers ingénieurs titulaire d’un diplôme informatique et inventeur du fax), et enfin, d’un ex patron des labos du CEA, fondateur de la première SSII française dédiée à l’Intelligence Artificielle : Ingenia.

Nous pûmes, grâce au 4e associé prélever dans le vivier du CEA les premières ressources compétentes en intelligence artificielle.
Le chercheur français Alain Bonnet, figure importante de la première IA française, avait fondé une société appelée Langage Naturel, installée à Montpellier en 1992. Elle développait SYLEX, un ensemble d’outils de traitement informatique du langage.

En 1993, Langage Naturel s’associe avec INGENIA et nous allons nous appuyer sur cette technologie. L’idée était de pouvoir traiter les centaines de milliers de courrier des clients de grandes entreprises comme la MAAF, Total, Bouygues Télécom, À travers le premier workflow de gestion opérationnelle, construit sur une base de données objet, faisons appel à l’intelligence artificielle, notamment pour la recherche en texte intégral ≠ compréhension du langage naturel, mais surtout de réaliser un système expert utilisant le traitement du langage pour interpréter son contenu. Thémis n’est plus simplement un souvenir anecdotique de l’informatique des années 1990.
Il fut bloqué à l’époque par l’échec commercial du client serveur maillon faible de la chaine gros système-architecture internet. Les DSI de l’époque étaient ultraconservatrices et le capital-risque balbutiant dans l’Hexagone.

Mais Thémis a constitué 30 ans plus tard le cas d’étude permettant de montrer qu’une partie des principes que l’on associe aujourd’hui au RAG existait déjà sous une autre forme : constituer un corpus documentaire, analyser linguistiquement son contenu, permettre une interrogation en langage naturel et restituer les documents pertinents.

De Thémis à HabPilot : la boucle est bouclée

Plus de trente ans après Thémis, HabPilot reprend finalement le même chemin avec des moyens devenus incomparables.

En 1993, avec SYLEX, nous cherchions à permettre à la machine d’analyser des documents, d’en comprendre suffisamment le langage pour les classer, les retrouver et alimenter un système expert. Aujourd’hui, le LLM et le RAG permettent d’aller beaucoup plus loin : retrouver la connaissance dans des milliers de documents et de données, la mettre en relation, la contextualiser, la synthétiser et restituer une réponse directement exploitable.

C’est le principe d’HabPilot : transformer la mémoire patrimoniale du bailleur social en une connaissance active, sécurisée et immédiatement mobilisable.
Mais surtout, nous avons choisi de ne pas construire une « IA qui sait tout».

HabPilot s’appuie sur des agents IA métiers spécialisés : stratégie patrimoniale et PSP, CUS, diagnostics réglementaires, transition énergétique, suivi des opérations, composants techniques, ventes, financements et subventions…

Chaque agent dispose de son périmètre, de ses données, de sa documentation de référence et de ses règles métier. Ensemble, ils constituent progressivement une intelligence patrimoniale collective au service des professionnels du logement social.

Le chemin parcouru depuis SYDONI et l’IRETIJ est immense. Pourtant, le projet intellectuel reste étonnamment semblable : rendre accessible et actionnable l’intelligence accumulée par les hommes.

En 1993, Thémis cherchait à comprendre les documents.

En 2026, HabPilot cherche à comprendre un patrimoine pour aider ceux qui le gèrent à décider.

Et après quarante-trois ans de parcours, la boucle est peut-être moins bouclée… qu’elle ne se prolonge.

Ressources bibliographiques

1. Frédéric Pigamo, Outils de traitement sémantique du langage naturel, 1990 – Thèse de doctorat de l’École nationale supérieure des télécommunications (ENST).

2. Bonnet & Pigamo, Recherche de références cataloguées à partir de requêtes en langage libre, 1991

3. Alain Chouraqui, L’informatique au service du droit, PUF, 1974.

¹LegalTech : ensemble des technologies numériques appliquées au droit pour rechercher, analyser, produire ou gérer l’information et les services juridiques.

²LLM (Large Language Model) : modèle d’IA entraîné sur de très grandes quantités de textes pour comprendre et générer du langage naturel.

³RAG (Retrieval-Augmented Generation) : technique qui permet à une IA de chercher d’abord l’information dans une base documentaire, puis de s’en servir pour construire sa réponse.

⁴Le problème intellectuel posé par Catala et son équipe est déjà très moderne : comment transformer une masse de décisions judiciaires en information interrogeable par la machine ? L’IRETIJ travaille notamment sur l’indexation des décisions, la fabrication d’« abstracts » et la sélection de jurisprudence et l’Indexation des décisions judiciaires.

⁵Coté « hard » Wang était incontestablement très en avance sur trois choses : traitement de texte, bureautique intégrée et recherche documentaire.

Ses systèmes de traitement de texte apparaissent dès les années 1970 ; au début des années 1980, Wang domine même le marché des systèmes de traitement de texte en grappes, associant postes de travail et serveurs de fichiers. Wang permettait de constituer un corpus électronique de documents bureautiques et d’effectuer des recherches à l’intérieur de ce corpus. C’est déjà une forme primitive de GED intelligente.