HOLCO Lab · Développeurs & architectes IA

Vos données métier.
Un contexte exploitable par vos agents.

HOLCO relie vos logiciels à vos assistants via MCP. La couche serveur prépare les données, exécute les contrôles et transmet une mémoire de travail traçable.

Connecteurs métierContrôles · contexte · mémoireVotre assistant / agent HOLCO

Architecture de référence au 9 septembre 2026. La feuille de route précise les capacités que nous voulons étendre.

01 / Architecture

Ce qui se passe entre la question et la réponse.

Vos systèmesCouche HOLCORestitutionERP / comptabilitéÉcritures et gestionAPISharePoint / documentsFichiers et collaborationGraphPaie / RHDonnées sociales autoriséesAPIPlanning / activitéÉchéances et tempsAPIContexte métierContrôles · mémoire · droitsRésultats structurés et provenancePérimètre cabinet / dossierMCPVotre assistantClient connecté en MCPInterneAgent HOLCOAppels modèle côté serveurDeux parcours possibles : réponse dans votre assistant ou orchestration par un agent HOLCO.

ERP / comptabilité · SharePoint / documents · Paie / RH · Planning / activité

HOLCO : contrôles, mémoire, droits

Votre assistant via MCP
ou un agent HOLCO côté serveur

  1. 01 · Lire

    Données autorisées

    ERP, SharePoint, paie, planning : accès selon les connecteurs activés et le périmètre du cabinet.

  2. 02 · Contrôler

    Calculs déterministes

    Seuils, rapprochements et écarts comptables sont calculés côté serveur, sans appel LLM pour ces contrôles.

  3. 03 · Contextualiser

    Mémoire + sources

    Les constats sont enrichis des règles actives du dossier, de leur provenance et des sources disponibles.

  4. 04 · Restituer

    Contexte structuré

    L’assistant reçoit les résultats utiles à sa réponse. La synthèse en langage naturel mobilise un modèle.

Révision continue, supervision et pile technique

Une boucle sous mandat

La revue nocturne s’exécute sur les comptes ayant activé ce fonctionnement. Elle conserve les constats et les rapproche des passages précédents pour préserver les décisions humaines. Le cabinet tranche les écarts dans sa console.

Le harnais regroupe les scripts de lancement, les vérifications et les preuves d’exécution. La surveillance de santé et des erreurs serveur est distincte de l’évaluation métier ; les alertes opérationnelles passent par ntfy.

Versions, sources et mise en production

Serveur MCP en Node.js 22.22.3 natif. SQLite en mode WAL pour la persistance principale du MCP ; PostgreSQL pour les usages analytiques. Frontend Next.js 16.3.4 / React en export statique, servi par Nginx ; services gérés par systemd.

WAL désigne le journal d’écriture de SQLite. Il ne désigne pas les évaluations des modèles. Les services annexes utilisent aussi Express et FastAPI, avec des versions propres à chaque service.

02 / RAG & mémoire

Retrouver le bon contexte. Conserver son origine.

Notre ambition : donner à l’agent les éléments pertinents du dossier, avec leur source, leur date et leur portée.

Le socle actuel assemble des objets de contexte et des règles actives, isolés par cabinet et dossier. Il transmet l’auteur, le validateur éventuel, la version et les dates de portée.

Le compactage retire une justification lorsqu’elle répète exactement le texte. Les métadonnées de provenance restent transmises.

Chaîne RAG cible · à généraliser
  1. 01DocumentsSources autorisées et versionnées
  2. 02PassagesChunking avec page, date et droits
  3. 03SélectionRecherche puis reclassement
  4. 04Réponse sourcéePassages transmis et citations vérifiées

Le socle actuel couvre notamment la mémoire structurée et sa provenance. La chaîne documentaire complète reste à évaluer par corpus.

Chunking, recherche et citations : le parcours que nous voulons généraliser

Préparer et retrouver

Découper les documents en passages cohérents (chunking), conserver document, page, version, droits et dates ; puis sélectionner les passages utiles à la question. La recherche hybride et le reclassement des résultats (reranking) font partie de la cible à évaluer sur chaque corpus.

Transmettre et vérifier

Un document trouvé ne suffit pas : le passage doit arriver dans le contexte du modèle avec sa référence. Nous voulons mesurer le rappel des sources, la précision des passages et la fidélité des citations, y compris lorsque la source manque, est périmée ou contredit une autre source.

Cette chaîne documentaire complète n’est pas présentée comme généralisée à tous les connecteurs. Le banc actuel vérifie notamment l’isolation et la transmission de la mémoire structurée.

03 / H-VISA · évaluation & révision

Du livrable à la preuve, puis au test rejouable.

Un contrôle de fichier examine un livrable dans un périmètre donné. Une évaluation du système compare son comportement à des attendus. La revue humaine arbitre le dossier : ces trois niveaux ne se remplacent pas.

Trois niveaux complémentaires : assertions de code, contradiction par des modèles, validation métier.

17 cassynthétiques dans le banc
imputation & mémoire
Référentiel expert : à constituer
Socle actuel

Harnais de non-régression

Rejeu des fonctions réelles sur des données fictives : isolation, activation, révocation, provenance et compactage. Un montant exact ou une règle d’accès se vérifie par assertion déterministe.

Mécanisme implémenté

Rédacteur, vérificateur, greffier

L’orchestration doctrinale confronte les affirmations aux extraits disponibles. Deux allers-retours au maximum ; un juge indisponible ou un désaccord persistant reste visible. Ce mécanisme ne constitue pas une certification métier.

Cible métier

Golden set & revue experte

Construire un jeu de référence validé par des professionnels : question, attendu, preuve et contre-exemple. Calibrer les juges LLM sur ces arbitrages humains, puis suivre les régressions dans un tableau de bord.

H-VISA : contrat de preuve, Langfuse et DeepEval

Ce que le rapport doit rendre vérifiable

Version du fichier, plages reçues, identifiant du run, règles et sources utilisées, calculs possibles et périmètre non couvert. Une empreinte identifie un instantané ; elle n’atteste pas son exhaustivité. Un onglet ajouté par l’assistant doit rester relié au résultat retourné par le contrôle.

Le parcours pilote ne donne pas accès automatiquement à toutes les cellules, aux pièces ou aux dates de mise en service. Un résultat partiel ou tronqué reste une limite à lever. Aucun cas client n’est publié ici.

Parcours de contrôle Excel →

Instrumenter ne signifie pas certifier

Langfuse permet de relier traces, observations et évaluations. DeepEval fournit un cadre de tests de sorties LLM. Leur présence dans une pile ne prouve ni la justesse d’un chiffre ni la calibration d’un juge. Les calculs déterministes précèdent le jugement de modèle ; les attendus métier demandent une validation indépendante.

Un contrôle technique réussi porte sur son critère. Il ne valide pas les comptes. Le banc de 17 cas cité ici est le rejeu synthétique imputation et mémoire documenté le 9 septembre, pas un score global du produit.

Documentation Langfuse · Documentation DeepEval

Complément contrôle mis à jour le 11 septembre 2026. H-VISA : guide DAF et exemples → · Construire les cas de référence →

Boucle d’évaluation métier visée
  1. 01Cas de référenceAttendu et preuve validés par un expert
  2. 02RejeuMême cas, version identifiée du système
  3. 03ÉcartAssertions puis jugement calibré si utile
  4. 04ArbitrageCorrection et contre-exemple à rejouer

L’arbitrage alimente le prochain rejeu. Le banc actuel contient 17 cas synthétiques ; le golden set expert reste à constituer.

Sources officielles, Légifrance et rôle du comité métier

Vérification sourcée

La couche de doctrine prévoit la lecture de sources officielles, notamment Légifrance via PISTE/DILA. Les verdicts distinguent confirmé, infirmé et invérifiable. L’accès à une API ne garantit ni la disponibilité du texte requis ni la couverture de tous les millésimes.

La date des faits, la version du texte et la couverture documentaire doivent accompagner la vérification. Une source inaccessible ne vaut pas validation.

Un board pour les attendus métier

Le comité d’experts visé définit les cas de référence et arbitre les désaccords. Les juges LLM servent à évaluer le raisonnement résiduel, après les contrôles déterministes ; leur calibration doit être comparée à des jugements humains indépendants.

Le banc synthétique actuel n’évalue pas la justesse globale d’une révision comptable. Nous souhaitons associer notamment 2C Finance à ce travail de référence ; le périmètre de contribution et la constitution du golden set restent à formaliser.

04 / Consommation LLM

Deux lieux d’exécution. Deux consommations.

A / Votre environnement

Le modèle de votre assistant

Il lit votre question, choisit les outils MCP, reçoit leurs résultats et produit la réponse. Ce contexte et cette génération consomment les ressources de votre abonnement ou de votre API, selon votre fournisseur.

Votre modèle + le contexte reçu via MCP
B / Environnement HOLCO

Les modèles appelés par nos agents

Lorsqu’un agent serveur, tel que Nora, ou une orchestration doctrinale appelle un modèle, cette consommation est distincte. Elle dépend du scénario, des tours d’outils et des vérifications exécutées.

Appels serveur + éventuelles étapes de jugement
Parcours A · réponse dans votre assistant
  1. 01Votre modèleComprend la question et choisit un outil
  2. 02HOLCO via MCPContrôles, sources et contexte
  3. 03Votre modèleLit les résultats et rédige la réponse
Parcours B · agent exécuté par HOLCO
  1. 01Agent serveurDéclenche la tâche autorisée
  2. 02Outils + modèle serveurItérations selon le scénario
  3. 03RestitutionRésultats et état de la tâche

Le parcours B ne se déclenche pas systématiquement pendant le parcours A. Chaque appel de modèle consomme dans son environnement d’exécution.

Un contrôle déterministe ne consomme pas de tokens LLM. Son résultat, lorsqu’il est lu par un modèle, contribue au contexte de ce modèle. Un appel MCP ne déclenche pas systématiquement un second LLM côté HOLCO.

Répartition des coûts et choix du modèle

Mesurer par parcours

La consommation de votre assistant relève de votre contrat fournisseur. Les appels opérés par HOLCO relèvent du service convenu avec vous ; leur inclusion ou refacturation doit être précisée dans l’offre. Une clé MCP est un identifiant d’accès, pas un crédit de tokens.

Les estimations de tokens du registre d’usage ne remplacent pas les relevés de facturation des fournisseurs. La cible est un suivi par tâche : modèle réel, entrée, sortie, cache, latence, coût et raison d’arrêt.

Adapter l’effort à la demande

Calcul ou seuil : code déterministe. Extraction ou reformulation bornée : modèle rapide à valider sur les cas attendus. Analyse complexe : modèle de raisonnement avec sources. Jugement d’une réponse : modèle évaluateur calibré sur le référentiel humain.

Nous voulons comparer qualité, coût et délai sur le même jeu de cas avant de retenir un modèle ou un réglage. Le routage automatique optimal reste un objectif à mesurer.

05 / Données & accès

Ce qui transite. Ce qui reste. Qui y accède.

Accès

Un périmètre explicite

Les lectures sont bornées par le compte, le dossier et les autorisations du connecteur. Une clé peut être rattachée à un collaborateur identifié ; les appels sont tracés par clé. Le périmètre d’écriture dépend des fonctions explicitement autorisées.

Transmission

Pseudonymisation activable

Option désactivée par défaut, configurable par compte. Les sorties d’outils concernées remplacent les identités par des alias ; la correspondance chiffrée reste côté serveur. Les données du dossier privé restent identifiables pour le cabinet.

Persistance

Une mémoire assumée

Les constats de révision, décisions, métadonnées de dossier et objets de mémoire sont conservés. Les caches et stockages documentaires dépendent du connecteur. Révoquer un accès et effacer les données conservées sont deux opérations distinctes.

Registre d’usage, protection et localisation

Ce que journalise un appel

Compte et utilisateur lorsqu’il est identifié, route, outil, connecteur, dossier, statut, latence, estimation de tokens, décision de politique et identifiant de requête. Ce registre ne contient pas le texte intégral de la conversation ; les stockages fonctionnels et les parcours conversationnels sont à examiner séparément.

Les empreintes SHA-256 chaînées permettent de vérifier la cohérence de la chaîne d’audit. Elles ne rendent pas à elles seules une base de données impossible à modifier. Des exports du registre et de la mémoire sont disponibles.

Frontières de protection

Le masquage d’identifiants bancaires porte sur les charges structurées traitées par le filtre ; il ne vaut pas garantie d’anonymisation de toute pièce jointe ou image. La pseudonymisation reste réversible.

L’infrastructure HOLCO est hébergée en France. Un volume LUKS protège les données applicatives sensibles et les secrets ; le disque système n’est pas entièrement chiffré. Le fournisseur de modèle et sa région de traitement constituent une frontière distincte à cadrer.

06 / Feuille de route

Vers une révision mesurable, de la source à la décision.

Nous voulons relier chaque réponse à ses sources, chaque évaluation à un attendu indépendant et chaque amélioration à une preuve de non-régression.

  1. 01

    Constituer le golden set métier

    Cas autorisés, attendus signés, contre-exemples et désaccords arbitrés par les experts.

  2. 02

    Évaluer la chaîne RAG de bout en bout

    Découpage, recherche, passages transmis, citations et traitement des sources absentes ou périmées.

  3. 03

    Unifier qualité, coût et supervision

    Un tableau de bord par tâche pour comparer les versions, calibrer les juges et borner les boucles d’agents.

Évaluons votre cas d’usage.

Un dossier test, un attendu métier, un parcours MCP à observer ensemble.

Échanger sur une démo