IA finance & comptabilité · HOLCO · juge LLM évaluation finance
Juge LLM en finance : quand un test suffit, testez
Mis à jour le 2026-09-07 · Lecture 4 min
Par Pierre Coquard
Réponse directe
Un juge LLM est un modèle qui note une réponse selon une grille. Dans la méthode HOLCO, il n'intervient que lorsqu'une assertion déterministe ne sait réellement pas vérifier la propriété recherchée, avec calibration contre des avis humains.
Votre première IA produit une réponse. Une deuxième explique qu'elle est bonne. Avez-vous gagné une preuve, ou seulement une deuxième opinion ?
Le juge LLM peut être utile. Mais il ne doit pas devenir le moyen de contourner un calcul vérifiable, une source manquante ou un contrat de sortie mal défini.
Ce que vous trouverez dans cette page
Une intention claire, une réponse longue, des sources professionnelles, des cas d'usage, une FAQ et des liens vers les guides voisins. Le parti pris est le même sur toutes nos ressources : répondre en une fois à la question posée, citer ce sur quoi la réponse repose, et dire ce que la couche HOLCO ne fait pas.
Commencer par nommer ce que l'on veut vérifier
Un total, une période, une unité, la présence d'une pièce, l'expiration d'une règle et l'exécution d'un contrôle peuvent relever d'assertions déterministes. Demander à un modèle de les apprécier ajoute une source de variabilité là où une comparaison explicite suffit.
Exemple fictif : une réponse indique 12 500 euros pour le dossier A en juin. Si la preuve validée porte 12 500 euros pour le dossier B en mai, le nombre seul ne rend pas la réponse juste. Comparez ensemble montant, unité, dossier, période et preuve.
Un format libre ne justifie pas automatiquement un juge. On peut d'abord structurer les affirmations et les résultats attendus pour rendre la comparaison mécanique.
Le juge intervient sur une propriété résiduelle
Certaines propriétés ne se réduisent pas facilement à une valeur attendue : une explication est-elle compréhensible pour son destinataire ? Une reformulation conserve-t-elle une nuance indispensable ? Un juge peut aider à examiner ces dimensions si les contrôles plus simples ne répondent pas réellement à la question.
Il faut limiter sa mission. Une note de clarté ne prouve pas la justesse comptable. Une note de cohérence ne démontre pas l'applicabilité d'une doctrine. Le juge doit disposer d'une grille explicite et pouvoir indiquer qu'il manque d'information.
Calibrer contre des cas humains, pas contre sa propre confiance
Préparez un ensemble de réponses notées par des professionnels selon la même grille. Conservez les désaccords entre humains et leur résolution. Comparez ensuite les décisions du juge, en distinguant les erreurs qu'il accepte et les réponses correctes qu'il rejette.
Séparez les exemples utilisés pour régler le juge d'un lot de contrôle indépendant. Conservez sa version, son instruction, le contexte fourni et les conditions d'exécution. Si le modèle change, les résultats antérieurs ne suffisent pas à démontrer sa calibration actuelle.
Un taux d'accord global peut masquer des erreurs graves. Il faut regarder les cas importants séparément et décider avant la campagne quelles erreurs sont inacceptables.
Deux avis ne sont pas nécessairement indépendants
Deux instructions différentes exécutées par le même modèle donnent deux lentilles, pas deux moteurs indépendants. Même des moteurs différents peuvent partager des erreurs ou recevoir les mêmes données incomplètes.
La diversité est un moyen de contradiction, pas une garantie. Ce qui reste décisif est la confrontation à une preuve ou à un attendu humain correctement établi. Le juge n'a pas autorité pour activer une règle de cabinet ni pour autoriser une livraison.
La règle pratique retenue par HOLCO
Assertion déterministe d'abord. Juge LLM seulement si elle ne suffit réellement pas pour la propriété visée, avec justification et calibration. Revue humaine lorsque les autres moyens ne permettent pas une évaluation valable du cas.
Cette hiérarchie concerne la notation des résultats rejoués. Elle ne retire pas le rôle initial de l'expert qui définit l'attendu métier. Le protocole écrit ne signifie pas qu'un juge a déjà été calibré ou déployé chez HOLCO.
À retenir
- Commencer par nommer ce que l'on veut vérifier
- Le juge intervient sur une propriété résiduelle
- Calibrer contre des cas humains, pas contre sa propre confiance
Questions à poser
- Faut-il un juge LLM pour vérifier un montant ?
- Un juge LLM remplace-t-il l'expert-comptable ?
- Pourquoi comparer le juge à des avis humains ?
Preuves à vérifier
- Anthropic : évaluer les agents IA
Dossier : évaluer l'IA en finance
Sources professionnelles
FAQ
Faut-il un juge LLM pour vérifier un montant ?
Pas si les données et le calcul de référence permettent une assertion. Comparer aussi l'unité, le dossier et la période, pas seulement le nombre.
Un juge LLM remplace-t-il l'expert-comptable ?
Non. Il évalue une propriété selon une grille. Il ne porte ni le mandat de revue, ni la décision métier, ni la validation d'une règle active.
Pourquoi comparer le juge à des avis humains ?
Pour mesurer ses désaccords et vérifier s'il applique la grille attendue, notamment sur les cas importants. Sa confiance déclarée ne constitue pas une calibration.
Contenu préparé avec l'assistance d'outils IA et publié à la demande de Pierre Coquard pour HOLCO.
Analysez un FEC en 30 secondes
Cadrages, contrôles et premiers écarts sur votre fichier des écritures comptables. Tout tourne dans votre navigateur : le fichier ne quitte jamais votre poste.
Analyser un FEC →Gratuit · cabinetDiagnostic : par quoi commencer
Le pré-diagnostic de votre cabinet : ce qui pèse le plus dans votre parc, et par quel contrôle commencer. Sans engagement, sans donnée comptable.
Faire le diagnostic →