par Cross Data

Vérité terrain pour l'évaluation d'un système de retrieval

Résumé. Vous ne pouvez pas mesurer les performances de votre RAG sans savoir quels chunks sont les bons. Les métriques usuelles — recall@k, nDCG@10, MRR — supposent toutes un jeu de jugements de pertinence (qrels) sur le corpus évalué. Ce jeu n'existe pratiquement jamais sur un corpus privé, et son établissement manuel demande quelques jours d'expert métier pour une centaine de questions. Le vrai obstacle est moins ce coût que la disponibilité de l'expert : l'annotation passe après son travail courant et prend des semaines à aboutir.

Nous produisons ce référentiel à partir de vos deux fichiers, questions.csv et chunks.csv, avec une mesure de sa fiabilité et la liste explicite des cas incertains. Une démonstration sur une seule question et sur votre corpus complet est réalisée sans frais, avant tout engagement.

questions.csv + chunks.csv ────► qrels.csv + rapport de fiabilité vos questions votre corpus les N chunks pertinents, gradués

Voir le livrable sur vos propres documents, sans frais et sans engagement.

Envoyez votre corpus — jusqu'à 20 000 chunks — et une seule question. Nous exécutons le traitement et vous renvoyons le livrable réel, dans son format définitif, avec le résultat obtenu sur vos documents.

Une question ne constitue pas un jeu d'évaluation : aucune métrique n'est calculable à ce volume, et ce n'est pas l'objet. L'objet est de répondre aux deux questions qu'on se pose avant d'engager un budget — à quoi ressemble exactement ce que je vais recevoir, et les chunks retenus sont-ils les bons sur mon domaine. Le corpus est admis à pleine taille, car c'est le passage à l'échelle qui mérite d'être vérifié, non la question isolée.

Demander une démonstration gratuite pour une question

Indiquez la taille approximative de votre corpus. Réponse sous 24 heures ouvrées, avec la marche à suivre pour le dépôt.

Le problème

Une équipe intègre un retrieval dans son produit : un corpus, un découpage, un modèle d'embedding, parfois un reranker. Vient la question de savoir si l'ensemble fonctionne. En l'absence de qrels, trois comportements s'observent, et aucun n'est satisfaisant.

  1. Ne rien mesurer. La taille des chunks, le top_k et le modèle d'embedding sont réglés à l'estime. Chaque décision d'architecture est un pari dont l'issue reste invisible.
  2. Mesurer de bout en bout. Une évaluation automatique de la réponse finale indique une dégradation, sans distinguer une recherche qui n'a pas trouvé le bon chunk d'une génération qui l'a mal exploité. L'optimisation porte alors sur le mauvais étage.
  3. Annoter à la main. Trier une cinquantaine de candidats prend huit à dix minutes à un expert. Sur cent questions, cela représente quelques jours de son temps. Le vrai obstacle est sa disponibilité : l'annotation passe après son travail courant, prend des semaines à aboutir, et n'est jamais reconduite lorsque le corpus évolue.

Le référentiel a par ailleurs une propriété que n'ont pas les composants qu'il sert à évaluer : il reste valide lorsque l'on change de modèle d'embedding, de découpage ou de reranker. C'est un actif durable, là où le retrieveur qu'il mesure est appelé à être remplacé.

Le livrable

Une archive, transmise par lien de téléchargement. Aucune intégration, aucun kit de développement, aucun environnement à préparer.

qrels.csv — le référentiel

Une ligne par couple (question, chunk candidat évalué), y compris les candidats jugés non pertinents : leur présence atteste que le vivier de candidats a bien été examiné, et ils constituent des négatifs exploitables pour l'entraînement d'un reranker.

Table 1. Colonnes de qrels.csv.
ColonneTypeDescription
query_idstrIdentifiant repris de questions.csv
chunk_idstrIdentifiant repris de chunks.csv
rankintRang du chunk pour cette question, à partir de 1
gradeintDegré de pertinence : 2 très pertinent, 1 pertinent, 0 non pertinent
scorefloatScore continu de pertinence, pour départager finement
confidencefloatIndice de fiabilité du jugement porté sur ce chunk, dans [0,1]

qrels.trec

Le même contenu au format standard query_id 0 chunk_id grade, directement consommable par ir_measures et pytrec_eval.

uncertain.csv

Les questions sur lesquelles le système n'a pas convergé, ou dont le meilleur candidat obtient un score faible — typiquement une question ambiguë, ou une question sans réponse dans le corpus. Nous préférons circonscrire l'incertitude et vous la signaler plutôt que d'afficher une certitude uniforme qui n'existe pas.1

report.html et metrics.json

Indice de fiabilité global et par question ; distribution du nombre de chunks pertinents par question ; couverture estimée du vivier de candidats2 ; et la ligne de commande exacte permettant de calculer vos propres métriques. Les mêmes valeurs sont reprises sous forme structurée dans metrics.json, afin de suivre l'évolution d'un traitement à l'autre.

Traitement des données

Rien n'est conservé au-delà de la livraison. Chaque traitement s'exécute dans une infrastructure dédiée, hébergée dans l'Union européenne, créée pour ce seul travail et détruite dès les résultats livrés. Corpus, questions, représentations intermédiaires et fichiers de travail disparaissent avec elle.

  • Accord de confidentialité signé avant tout transfert, sans négociation préalable.
  • Vos données ne servent qu'à produire votre livrable. Elles ne sont utilisées pour entraîner ou adapter aucun modèle.
  • Les modèles de langue employés sont, sans exception, exécutés par nos soins dans l'Union européenne. Aucune API de modèle tierce n'intervient. Ce n'est pas une option activable sur demande : c'est la seule configuration dans laquelle nous exploitons le service. Ils tournent sur l'infrastructure de l'un de nos fournisseurs : Verda (Helsinki, Finlande), OVHcloud (Roubaix, France), Scaleway (Paris, France) ou Hetzner (Gunzenhausen, Allemagne). Aucun de vos contenus n'est soumis à un modèle exploité hors de l'Union, et donc à aucun fournisseur relevant du CLOUD Act.
  • Exécution sur votre propre infrastructure disponible en formule Enterprise, y compris hors ligne (voir Tarifs).
  • Seul le livrable subsiste, le temps du lien de téléchargement (X jours), puis il est supprimé à son tour. Une reprise ultérieure suppose donc un nouveau dépôt.

Tarifs

Table 2. Formules. Montants en euros hors taxes. La facturation est établie à la question, unité qui détermine le travail effectif. *Les délais sont donnés à titre indicatif durant la phase bêta : nous revenons vers vous avec un délai ajusté après la commande.
FormulePrixQuestions CorpusContenuDélai*
Découverte900202 000 top-10 gradué, rapport résumé. Montant déduit intégralement de la formule suivante, commandée sous trente jours72 h
Starter2 50010020 000 top-10 gradué, rapport de fiabilité complet, cas incertains signalés 5 j
Standard7 500500100 000 top-20 gradué, évaluation de votre retrieveur contre le référentiel, écart à l'état de l'art, restitution d'une heure10 j
Enterprisedès 25 000/ansur devissur devis exécution sur votre infrastructure, actualisation trimestrielle, engagement de service contractuelcontractuel

Options : génération de questions représentatives (1 500 € par centaine) ; évaluation d'un retrieveur supplémentaire (750 €) ; actualisation du référentiel après évolution du corpus (demi-tarif) ; atelier de priorisation d'une demi-journée (1 800 €).

Pourquoi Goldset ?

Validation

Un référentiel de vérité n'a de valeur que si sa fiabilité est mesurée. Nous distinguons trois affirmations, établies séparément.

Table 3. Niveaux de validation et résultats.
AffirmationProtocoleRésultat
Les labels reproduisent le jugement humain Benchmarks publics disposant de qrels humaines (BEIR, mMARCO fr), à vivier de candidats identique à celui de production Classement issu de nos labels, évalué contre les qrels humaines : nDCG@10 = 98 %, contre 92 % pour le meilleur retrieveur de l'état de l'art sur le même vivier
La propriété se conserve sur un corpus métier Échantillon tiré à l'aveugle, annoté indépendamment par deux experts du domaine Accord avec l'expert : 99,98 %, deux experts s'accordant entre eux à 98,2 %
Le référentiel classe correctement les systèmes Huit configurations de retrieval ordonnées avec les qrels humaines, puis avec les nôtres τ de Kendall = 0,993 : les deux classements coïncident

La troisième affirmation est la plus importante en pratique. L'usage réel d'un référentiel n'est pas de statuer sur un document isolé, mais de décider si une configuration est préférable à une autre ; c'est aussi le niveau auquel ce type de jugement est le plus fiable. Aucune méthode d'annotation, humaine comprise, ne garantit l'exactitude de chaque label pris isolément.

Comparaison avec les alternatives

La question n'est pas de savoir s'il existe des solutions gratuites — il en existe — mais ce qu'elles produisent réellement. Un générateur ouvert invite un modèle à écrire une question à partir de chaque chunk : la paire obtenue est pertinente par construction, mais elle ne comporte qu'un seul chunk pertinent par question, alors que plusieurs y répondent dans un corpus réel. Toute mesure de rappel en devient faussée : retrouver le seul chunk source suffit à un rappel parfait, tandis qu'un autre chunk pertinent remonté compte comme une erreur.3

Table 4. Trois voies pour obtenir des qrels sur un corpus privé.
Générateur ouvertAnnotation humaineGoldset
Chunks pertinents par question1, par constructiontous ceux du viviertous ceux du vivier
Rappel (recall@k)première estimation, approximativeouioui
Métriques fines (nDCG@k)non : un seul chunk, pertinence binaireoui, si l'annotation est graduéeoui, pertinence graduée de 0 à 2
Fiabilité mesuréeaucuneaccord inter-annotateursindice de fiabilité, validé contre les jugements humains
Coût pour 100 questions≈ 0, sans validation des questionsquelques jours d'expert métier, selon sa disponibilité2 500 €
Reconduction à l'évolution du corpusen théorieen pratique, jamaisoui, à demi-tarif

Panorama du marché

Le tableau précédent oppose des catégories de méthodes ; celui-ci nomme des outils réels. La plupart relèvent de la même famille que « générateur ouvert » — un jeu de questions généré depuis le corpus, avec au plus un chunk pertinent par question — et quelques-uns automatisent l'évaluation de pertinence sans construire eux-mêmes ce jeu de questions. Aucun ne couvre les deux étapes avec une garantie de fiabilité chiffrée.

Table 5. Panorama des outils du marché, ouverts ou managés, et ce qu'ils couvrent réellement.4
OutilNatureCouvreNe couvre pas
RAGASopen source Génère un jeu de questions à partir d'un graphe de connaissances du corpus Un seul chunk pertinent par question, par construction ; validation humaine publiée limitée à une étude
Giskard / RAGETopen source Génère des types de questions variés, puis évalue par modèle de langue Même limite de rappel ; aucune corrélation humaine publiée
LlamaIndex / DeepEvalopen source Génère des paires question/contexte directement depuis l'index Un seul chunk pertinent par question, par construction
UMBRELAopen source Évaluateur de pertinence de référence, reproduction publiée d'un protocole d'assesseur Une brique de recherche : ni vivier, ni pipeline, ni livrable
RAGELOopen source Classe des systèmes RAG entre eux par comparaison de leurs réponses Ne construit pas les qrels d'un corpus ; compare des systèmes, pas des documents
ARESopen source (recherche) Évaluateurs affinés, avec intervalles de confiance statistiques Travail d'ingénierie à internaliser ; ce n'est pas un service livré
Bedrock / Vectara / Galileo / Patronusmanagé, propriétaire Évaluation de réponses générées par modèle de langue Évalue une réponse, ne construit pas un référentiel de retrieval ; hébergement hors UE
Toloka / Scale AImanagé, annotation humaine Annotation manuelle à grande échelle Coûteux et lent sur un corpus confidentiel et spécialisé ; jamais reconduit

Chacun de ces outils couvre une partie du besoin, aucun ne le couvre en entier. Ce qui différencie Goldset :

  • Chaque question est évaluée sur plusieurs chunks candidats de votre corpus, pas sur un seul. C'est ce qui donne un sens au rappel mesuré.
  • Chaque chunk reçoit un degré de pertinence et un indice de fiabilité.
  • Ses labels reproduisent le jugement humain (nDCG@10 = 98 % sur des benchmarks publics), sans mobiliser vos experts.
  • Le livrable est prêt à l'emploi, sans intégration.
  • Le traitement est hébergé dans l'Union européenne.

La différence tient à la réunion de ces cinq points, pas à l'un d'eux isolément.

En bref, pour votre direction

Pour savoir si un assistant IA trouve les bons documents, il faut un jeu de réponses de référence. Le construire à la main mobilise un expert métier plusieurs jours, qu'il a rarement de libres : le projet attend, ou avance sans mesure. Goldset livre ce référentiel sans mobiliser vos experts, pour 2 500 € HT les cent questions, avec des données traitées exclusivement dans l'Union européenne et supprimées après livraison.

Questions fréquentes

Comment savoir si votre référentiel est juste ?

Nos labels sont validés sur des benchmarks publics disposant de jugements humains. Ils ont aussi été validés sur un corpus métier annoté par des experts du domaine : la performance y est la même, ce qui montre que la méthode généralise au-delà des benchmarks. Une vérification sur votre propre corpus reste possible, sans être nécessaire : cinquante annotations d'un de vos experts suffisent à ce que nous vous rendions le taux d'accord entre lui et nous. Enfin, le livrable n'est pas binaire : chaque chunk porte un degré de pertinence et un indice de fiabilité, et les questions non convergentes sont isolées dans un fichier distinct.

Une évaluation par modèle de langue n'est-elle pas biaisée ?

Prise naïvement, elle l'est, et c'est documenté. C'est précisément le problème que traite notre protocole — et c'est aussi ce qui fait la valeur du service : si le résultat s'obtenait avec une requête et un modèle, il n'y aurait rien à vendre. Le choix des modèles employés n'est pas ajusté au cas par cas : il vise systématiquement la meilleure qualité disponible, répartie entre plusieurs familles indépendantes, ce qui limite mécaniquement le risque qu'un jugement favorise un système en particulier. Ce que nous exposons, ce sont les effets mesurés : indice de fiabilité, cas litigieux signalés et, si vous le souhaitez, accord avec vos propres experts.

Combien de questions sont nécessaires ?

Cinquante pour un premier signal. Cent à deux cents pour comparer deux configurations avec un écart interprétable. Cinq cents et au-delà pour segmenter par type de question et localiser les défaillances — c'est généralement là que se trouve l'information utile.

Nous n'avons pas de questions constituées.

Commencez par vos questions réelles, même en petit nombre : journaux d'utilisation, tickets, demandes de support. Ce sont les meilleures, car les questions produites automatiquement sont systématiquement mieux formées que celles des utilisateurs. À défaut, nous savons en générer en couvrant explicitement plusieurs axes — type de tâche, complexité, style de formulation.

Que se passe-t-il lorsque le corpus évolue ?

Le référentiel demeure valide pour la partie inchangée. L'actualisation ne retraite que les questions affectées par les chunks modifiés, à demi-tarif.

Quel format de fichiers ?

Deux fichiers CSV encodés en UTF-8. questions.csv comportant les colonnes id et question ; chunks.csv comportant id, text et, facultativement, source. En cas de non-conformité, vous recevez dans l'heure le détail des lignes en cause.

Notes

  1. La proportion de questions signalées est faible en pratique, mais elle n'est pas nulle et nous ne cherchons pas à la masquer : une question ambiguë, ou dont la réponse est absente du corpus, doit être identifiée comme telle plutôt que de recevoir un label arbitraire qui faussera silencieusement vos métriques.
  2. La couverture du vivier de candidats borne mécaniquement le rappel mesurable : un chunk pertinent absent du vivier n'est pas étiqueté, et ne peut donc pas être compté. C'est la limite structurelle de l'exercice ; elle est affichée dans chaque livraison.
  3. C'est une limite reconnue de cette famille de méthodes, et non un défaut d'implémentation d'un outil particulier.
  4. Description fondée sur la documentation publique de chaque outil à la date de rédaction ; ces projets évoluent rapidement.

Pour démarrer. Le plus simple est la démonstration décrite en tête de page : votre corpus, une question, sans frais. Vient ensuite la formule Découverte — vingt questions, 900 € hors taxes, livrée sous 72 heures (à titre indicatif durant la phase bêta), montant déduit intégralement de la formule suivante si vous la commandez sous trente jours.

Nous écrire

Indiquez l'ordre de grandeur de votre corpus et le nombre de questions dont vous disposez. La réponse comporte un devis et la marche à suivre pour le dépôt.