Harnais de non-régression
Rejeu des fonctions réelles sur des données fictives : isolation, activation, révocation, provenance et compactage. Un montant exact ou une règle d’accès se vérifie par assertion déterministe.
HOLCO Lab · Développeurs & architectes IA
HOLCO relie vos logiciels à vos assistants via MCP. La couche serveur prépare les données, exécute les contrôles et transmet une mémoire de travail traçable.
Architecture de référence au 9 septembre 2026. La feuille de route précise les capacités que nous voulons étendre.
01 / Architecture
ERP / comptabilité · SharePoint / documents · Paie / RH · Planning / activité
HOLCO : contrôles, mémoire, droitsVotre assistant via MCP
ou un agent HOLCO côté serveur
ERP, SharePoint, paie, planning : accès selon les connecteurs activés et le périmètre du cabinet.
Seuils, rapprochements et écarts comptables sont calculés côté serveur, sans appel LLM pour ces contrôles.
Les constats sont enrichis des règles actives du dossier, de leur provenance et des sources disponibles.
L’assistant reçoit les résultats utiles à sa réponse. La synthèse en langage naturel mobilise un modèle.
La revue nocturne s’exécute sur les comptes ayant activé ce fonctionnement. Elle conserve les constats et les rapproche des passages précédents pour préserver les décisions humaines. Le cabinet tranche les écarts dans sa console.
Le harnais regroupe les scripts de lancement, les vérifications et les preuves d’exécution. La surveillance de santé et des erreurs serveur est distincte de l’évaluation métier ; les alertes opérationnelles passent par ntfy.
Serveur MCP en Node.js 22.22.3 natif. SQLite en mode WAL pour la persistance principale du MCP ; PostgreSQL pour les usages analytiques. Frontend Next.js 16.3.4 / React en export statique, servi par Nginx ; services gérés par systemd.
WAL désigne le journal d’écriture de SQLite. Il ne désigne pas les évaluations des modèles. Les services annexes utilisent aussi Express et FastAPI, avec des versions propres à chaque service.
02 / RAG & mémoire
Notre ambition : donner à l’agent les éléments pertinents du dossier, avec leur source, leur date et leur portée.
Le socle actuel assemble des objets de contexte et des règles actives, isolés par cabinet et dossier. Il transmet l’auteur, le validateur éventuel, la version et les dates de portée.
Le compactage retire une justification lorsqu’elle répète exactement le texte. Les métadonnées de provenance restent transmises.
Le socle actuel couvre notamment la mémoire structurée et sa provenance. La chaîne documentaire complète reste à évaluer par corpus.
Découper les documents en passages cohérents (chunking), conserver document, page, version, droits et dates ; puis sélectionner les passages utiles à la question. La recherche hybride et le reclassement des résultats (reranking) font partie de la cible à évaluer sur chaque corpus.
Un document trouvé ne suffit pas : le passage doit arriver dans le contexte du modèle avec sa référence. Nous voulons mesurer le rappel des sources, la précision des passages et la fidélité des citations, y compris lorsque la source manque, est périmée ou contredit une autre source.
Cette chaîne documentaire complète n’est pas présentée comme généralisée à tous les connecteurs. Le banc actuel vérifie notamment l’isolation et la transmission de la mémoire structurée.
03 / H-VISA · évaluation & révision
Un contrôle de fichier examine un livrable dans un périmètre donné. Une évaluation du système compare son comportement à des attendus. La revue humaine arbitre le dossier : ces trois niveaux ne se remplacent pas.
Trois niveaux complémentaires : assertions de code, contradiction par des modèles, validation métier.
Rejeu des fonctions réelles sur des données fictives : isolation, activation, révocation, provenance et compactage. Un montant exact ou une règle d’accès se vérifie par assertion déterministe.
L’orchestration doctrinale confronte les affirmations aux extraits disponibles. Deux allers-retours au maximum ; un juge indisponible ou un désaccord persistant reste visible. Ce mécanisme ne constitue pas une certification métier.
Construire un jeu de référence validé par des professionnels : question, attendu, preuve et contre-exemple. Calibrer les juges LLM sur ces arbitrages humains, puis suivre les régressions dans un tableau de bord.
Version du fichier, plages reçues, identifiant du run, règles et sources utilisées, calculs possibles et périmètre non couvert. Une empreinte identifie un instantané ; elle n’atteste pas son exhaustivité. Un onglet ajouté par l’assistant doit rester relié au résultat retourné par le contrôle.
Le parcours pilote ne donne pas accès automatiquement à toutes les cellules, aux pièces ou aux dates de mise en service. Un résultat partiel ou tronqué reste une limite à lever. Aucun cas client n’est publié ici.
Parcours de contrôle Excel →Langfuse permet de relier traces, observations et évaluations. DeepEval fournit un cadre de tests de sorties LLM. Leur présence dans une pile ne prouve ni la justesse d’un chiffre ni la calibration d’un juge. Les calculs déterministes précèdent le jugement de modèle ; les attendus métier demandent une validation indépendante.
Un contrôle technique réussi porte sur son critère. Il ne valide pas les comptes. Le banc de 17 cas cité ici est le rejeu synthétique imputation et mémoire documenté le 9 septembre, pas un score global du produit.
Complément contrôle mis à jour le 11 septembre 2026. H-VISA : guide DAF et exemples → · Construire les cas de référence →
L’arbitrage alimente le prochain rejeu. Le banc actuel contient 17 cas synthétiques ; le golden set expert reste à constituer.
La couche de doctrine prévoit la lecture de sources officielles, notamment Légifrance via PISTE/DILA. Les verdicts distinguent confirmé, infirmé et invérifiable. L’accès à une API ne garantit ni la disponibilité du texte requis ni la couverture de tous les millésimes.
La date des faits, la version du texte et la couverture documentaire doivent accompagner la vérification. Une source inaccessible ne vaut pas validation.
Le comité d’experts visé définit les cas de référence et arbitre les désaccords. Les juges LLM servent à évaluer le raisonnement résiduel, après les contrôles déterministes ; leur calibration doit être comparée à des jugements humains indépendants.
Le banc synthétique actuel n’évalue pas la justesse globale d’une révision comptable. Nous souhaitons associer notamment 2C Finance à ce travail de référence ; le périmètre de contribution et la constitution du golden set restent à formaliser.
04 / Consommation LLM
Il lit votre question, choisit les outils MCP, reçoit leurs résultats et produit la réponse. Ce contexte et cette génération consomment les ressources de votre abonnement ou de votre API, selon votre fournisseur.
Votre modèle + le contexte reçu via MCPLorsqu’un agent serveur, tel que Nora, ou une orchestration doctrinale appelle un modèle, cette consommation est distincte. Elle dépend du scénario, des tours d’outils et des vérifications exécutées.
Appels serveur + éventuelles étapes de jugementLe parcours B ne se déclenche pas systématiquement pendant le parcours A. Chaque appel de modèle consomme dans son environnement d’exécution.
Un contrôle déterministe ne consomme pas de tokens LLM. Son résultat, lorsqu’il est lu par un modèle, contribue au contexte de ce modèle. Un appel MCP ne déclenche pas systématiquement un second LLM côté HOLCO.
La consommation de votre assistant relève de votre contrat fournisseur. Les appels opérés par HOLCO relèvent du service convenu avec vous ; leur inclusion ou refacturation doit être précisée dans l’offre. Une clé MCP est un identifiant d’accès, pas un crédit de tokens.
Les estimations de tokens du registre d’usage ne remplacent pas les relevés de facturation des fournisseurs. La cible est un suivi par tâche : modèle réel, entrée, sortie, cache, latence, coût et raison d’arrêt.
Calcul ou seuil : code déterministe. Extraction ou reformulation bornée : modèle rapide à valider sur les cas attendus. Analyse complexe : modèle de raisonnement avec sources. Jugement d’une réponse : modèle évaluateur calibré sur le référentiel humain.
Nous voulons comparer qualité, coût et délai sur le même jeu de cas avant de retenir un modèle ou un réglage. Le routage automatique optimal reste un objectif à mesurer.
05 / Données & accès
Les lectures sont bornées par le compte, le dossier et les autorisations du connecteur. Une clé peut être rattachée à un collaborateur identifié ; les appels sont tracés par clé. Le périmètre d’écriture dépend des fonctions explicitement autorisées.
Option désactivée par défaut, configurable par compte. Les sorties d’outils concernées remplacent les identités par des alias ; la correspondance chiffrée reste côté serveur. Les données du dossier privé restent identifiables pour le cabinet.
Les constats de révision, décisions, métadonnées de dossier et objets de mémoire sont conservés. Les caches et stockages documentaires dépendent du connecteur. Révoquer un accès et effacer les données conservées sont deux opérations distinctes.
Compte et utilisateur lorsqu’il est identifié, route, outil, connecteur, dossier, statut, latence, estimation de tokens, décision de politique et identifiant de requête. Ce registre ne contient pas le texte intégral de la conversation ; les stockages fonctionnels et les parcours conversationnels sont à examiner séparément.
Les empreintes SHA-256 chaînées permettent de vérifier la cohérence de la chaîne d’audit. Elles ne rendent pas à elles seules une base de données impossible à modifier. Des exports du registre et de la mémoire sont disponibles.
Le masquage d’identifiants bancaires porte sur les charges structurées traitées par le filtre ; il ne vaut pas garantie d’anonymisation de toute pièce jointe ou image. La pseudonymisation reste réversible.
L’infrastructure HOLCO est hébergée en France. Un volume LUKS protège les données applicatives sensibles et les secrets ; le disque système n’est pas entièrement chiffré. Le fournisseur de modèle et sa région de traitement constituent une frontière distincte à cadrer.
06 / Feuille de route
Nous voulons relier chaque réponse à ses sources, chaque évaluation à un attendu indépendant et chaque amélioration à une preuve de non-régression.
Cas autorisés, attendus signés, contre-exemples et désaccords arbitrés par les experts.
Découpage, recherche, passages transmis, citations et traitement des sources absentes ou périmées.
Un tableau de bord par tâche pour comparer les versions, calibrer les juges et borner les boucles d’agents.
Un dossier test, un attendu métier, un parcours MCP à observer ensemble.