Le problème
Une équipe intègre un retrieval dans son produit : un corpus, un découpage, un modèle d'embedding, parfois un reranker. Vient la question de savoir si l'ensemble fonctionne. En l'absence de qrels, trois comportements s'observent, et aucun n'est satisfaisant.
- Ne rien mesurer. La taille des chunks, le
top_ket le modèle d'embedding sont réglés à l'estime. Chaque décision d'architecture est un pari dont l'issue reste invisible. - Mesurer de bout en bout. Une évaluation automatique de la réponse finale indique une dégradation, sans distinguer une recherche qui n'a pas trouvé le bon chunk d'une génération qui l'a mal exploité. L'optimisation porte alors sur le mauvais étage.
- Annoter à la main. Trier une cinquantaine de candidats prend huit à dix minutes à un expert. Sur cent questions, cela représente quelques jours de son temps. Le vrai obstacle est sa disponibilité : l'annotation passe après son travail courant, prend des semaines à aboutir, et n'est jamais reconduite lorsque le corpus évolue.
Le référentiel a par ailleurs une propriété que n'ont pas les composants qu'il sert à évaluer : il reste valide lorsque l'on change de modèle d'embedding, de découpage ou de reranker. C'est un actif durable, là où le retrieveur qu'il mesure est appelé à être remplacé.
Le livrable
Une archive, transmise par lien de téléchargement. Aucune intégration, aucun kit de développement, aucun environnement à préparer.
qrels.csv — le référentiel
Une ligne par couple (question, chunk candidat évalué), y compris les candidats jugés non pertinents : leur présence atteste que le vivier de candidats a bien été examiné, et ils constituent des négatifs exploitables pour l'entraînement d'un reranker.
| Colonne | Type | Description |
|---|---|---|
query_id | str | Identifiant repris de questions.csv |
chunk_id | str | Identifiant repris de chunks.csv |
rank | int | Rang du chunk pour cette question, à partir de 1 |
grade | int | Degré de pertinence : 2 très pertinent, 1 pertinent, 0 non pertinent |
score | float | Score continu de pertinence, pour départager finement |
confidence | float | Indice de fiabilité du jugement porté sur ce chunk, dans [0,1] |
qrels.trec
Le même contenu au format standard query_id 0 chunk_id grade,
directement consommable par ir_measures et pytrec_eval.
uncertain.csv
Les questions sur lesquelles le système n'a pas convergé, ou dont le meilleur candidat obtient un score faible — typiquement une question ambiguë, ou une question sans réponse dans le corpus. Nous préférons circonscrire l'incertitude et vous la signaler plutôt que d'afficher une certitude uniforme qui n'existe pas.1
report.html et metrics.json
Indice de fiabilité global et par question ; distribution du nombre de chunks
pertinents par question ; couverture estimée du vivier de candidats2 ; et la ligne de
commande exacte permettant de calculer vos propres métriques. Les mêmes valeurs sont
reprises sous forme structurée dans metrics.json, afin de suivre
l'évolution d'un traitement à l'autre.
Traitement des données
Rien n'est conservé au-delà de la livraison. Chaque traitement s'exécute dans une infrastructure dédiée, hébergée dans l'Union européenne, créée pour ce seul travail et détruite dès les résultats livrés. Corpus, questions, représentations intermédiaires et fichiers de travail disparaissent avec elle.
- Accord de confidentialité signé avant tout transfert, sans négociation préalable.
- Vos données ne servent qu'à produire votre livrable. Elles ne sont utilisées pour entraîner ou adapter aucun modèle.
- Les modèles de langue employés sont, sans exception, exécutés par nos soins dans l'Union européenne. Aucune API de modèle tierce n'intervient. Ce n'est pas une option activable sur demande : c'est la seule configuration dans laquelle nous exploitons le service. Ils tournent sur l'infrastructure de l'un de nos fournisseurs : Verda (Helsinki, Finlande), OVHcloud (Roubaix, France), Scaleway (Paris, France) ou Hetzner (Gunzenhausen, Allemagne). Aucun de vos contenus n'est soumis à un modèle exploité hors de l'Union, et donc à aucun fournisseur relevant du CLOUD Act.
- Exécution sur votre propre infrastructure disponible en formule Enterprise, y compris hors ligne (voir Tarifs).
- Seul le livrable subsiste, le temps du lien de téléchargement (X jours), puis il est supprimé à son tour. Une reprise ultérieure suppose donc un nouveau dépôt.
Tarifs
| Formule | Prix | Questions | Corpus | Contenu | Délai* |
|---|---|---|---|---|---|
| Découverte | 900 | 20 | 2 000 | top-10 gradué, rapport résumé. Montant déduit intégralement de la formule suivante, commandée sous trente jours | 72 h |
| Starter | 2 500 | 100 | 20 000 | top-10 gradué, rapport de fiabilité complet, cas incertains signalés | 5 j |
| Standard | 7 500 | 500 | 100 000 | top-20 gradué, évaluation de votre retrieveur contre le référentiel, écart à l'état de l'art, restitution d'une heure | 10 j |
| Enterprise | dès 25 000/an | sur devis | sur devis | exécution sur votre infrastructure, actualisation trimestrielle, engagement de service contractuel | contractuel |
Options : génération de questions représentatives (1 500 € par centaine) ; évaluation d'un retrieveur supplémentaire (750 €) ; actualisation du référentiel après évolution du corpus (demi-tarif) ; atelier de priorisation d'une demi-journée (1 800 €).
Pourquoi Goldset ?
Validation
Un référentiel de vérité n'a de valeur que si sa fiabilité est mesurée. Nous distinguons trois affirmations, établies séparément.
| Affirmation | Protocole | Résultat |
|---|---|---|
| Les labels reproduisent le jugement humain | Benchmarks publics disposant de qrels humaines (BEIR, mMARCO fr), à vivier de candidats identique à celui de production | Classement issu de nos labels, évalué contre les qrels humaines : nDCG@10 = 98 %, contre 92 % pour le meilleur retrieveur de l'état de l'art sur le même vivier |
| La propriété se conserve sur un corpus métier | Échantillon tiré à l'aveugle, annoté indépendamment par deux experts du domaine | Accord avec l'expert : 99,98 %, deux experts s'accordant entre eux à 98,2 % |
| Le référentiel classe correctement les systèmes | Huit configurations de retrieval ordonnées avec les qrels humaines, puis avec les nôtres | τ de Kendall = 0,993 : les deux classements coïncident |
La troisième affirmation est la plus importante en pratique. L'usage réel d'un référentiel n'est pas de statuer sur un document isolé, mais de décider si une configuration est préférable à une autre ; c'est aussi le niveau auquel ce type de jugement est le plus fiable. Aucune méthode d'annotation, humaine comprise, ne garantit l'exactitude de chaque label pris isolément.
Comparaison avec les alternatives
La question n'est pas de savoir s'il existe des solutions gratuites — il en existe — mais ce qu'elles produisent réellement. Un générateur ouvert invite un modèle à écrire une question à partir de chaque chunk : la paire obtenue est pertinente par construction, mais elle ne comporte qu'un seul chunk pertinent par question, alors que plusieurs y répondent dans un corpus réel. Toute mesure de rappel en devient faussée : retrouver le seul chunk source suffit à un rappel parfait, tandis qu'un autre chunk pertinent remonté compte comme une erreur.3
| Générateur ouvert | Annotation humaine | Goldset | |
|---|---|---|---|
| Chunks pertinents par question | 1, par construction | tous ceux du vivier | tous ceux du vivier |
Rappel (recall@k) | première estimation, approximative | oui | oui |
Métriques fines (nDCG@k) | non : un seul chunk, pertinence binaire | oui, si l'annotation est graduée | oui, pertinence graduée de 0 à 2 |
| Fiabilité mesurée | aucune | accord inter-annotateurs | indice de fiabilité, validé contre les jugements humains |
| Coût pour 100 questions | ≈ 0, sans validation des questions | quelques jours d'expert métier, selon sa disponibilité | 2 500 € |
| Reconduction à l'évolution du corpus | en théorie | en pratique, jamais | oui, à demi-tarif |
Panorama du marché
Le tableau précédent oppose des catégories de méthodes ; celui-ci nomme des outils réels. La plupart relèvent de la même famille que « générateur ouvert » — un jeu de questions généré depuis le corpus, avec au plus un chunk pertinent par question — et quelques-uns automatisent l'évaluation de pertinence sans construire eux-mêmes ce jeu de questions. Aucun ne couvre les deux étapes avec une garantie de fiabilité chiffrée.
| Outil | Nature | Couvre | Ne couvre pas |
|---|---|---|---|
| RAGAS | open source | Génère un jeu de questions à partir d'un graphe de connaissances du corpus | Un seul chunk pertinent par question, par construction ; validation humaine publiée limitée à une étude |
| Giskard / RAGET | open source | Génère des types de questions variés, puis évalue par modèle de langue | Même limite de rappel ; aucune corrélation humaine publiée |
| LlamaIndex / DeepEval | open source | Génère des paires question/contexte directement depuis l'index | Un seul chunk pertinent par question, par construction |
| UMBRELA | open source | Évaluateur de pertinence de référence, reproduction publiée d'un protocole d'assesseur | Une brique de recherche : ni vivier, ni pipeline, ni livrable |
| RAGELO | open source | Classe des systèmes RAG entre eux par comparaison de leurs réponses | Ne construit pas les qrels d'un corpus ; compare des systèmes, pas des documents |
| ARES | open source (recherche) | Évaluateurs affinés, avec intervalles de confiance statistiques | Travail d'ingénierie à internaliser ; ce n'est pas un service livré |
| Bedrock / Vectara / Galileo / Patronus | managé, propriétaire | Évaluation de réponses générées par modèle de langue | Évalue une réponse, ne construit pas un référentiel de retrieval ; hébergement hors UE |
| Toloka / Scale AI | managé, annotation humaine | Annotation manuelle à grande échelle | Coûteux et lent sur un corpus confidentiel et spécialisé ; jamais reconduit |
Chacun de ces outils couvre une partie du besoin, aucun ne le couvre en entier. Ce qui différencie Goldset :
- Chaque question est évaluée sur plusieurs chunks candidats de votre corpus, pas sur un seul. C'est ce qui donne un sens au rappel mesuré.
- Chaque chunk reçoit un degré de pertinence et un indice de fiabilité.
- Ses labels reproduisent le jugement humain (nDCG@10 = 98 % sur des benchmarks publics), sans mobiliser vos experts.
- Le livrable est prêt à l'emploi, sans intégration.
- Le traitement est hébergé dans l'Union européenne.
La différence tient à la réunion de ces cinq points, pas à l'un d'eux isolément.
En bref, pour votre direction
Pour savoir si un assistant IA trouve les bons documents, il faut un jeu de réponses de référence. Le construire à la main mobilise un expert métier plusieurs jours, qu'il a rarement de libres : le projet attend, ou avance sans mesure. Goldset livre ce référentiel sans mobiliser vos experts, pour 2 500 € HT les cent questions, avec des données traitées exclusivement dans l'Union européenne et supprimées après livraison.
Questions fréquentes
- Comment savoir si votre référentiel est juste ?
Nos labels sont validés sur des benchmarks publics disposant de jugements humains. Ils ont aussi été validés sur un corpus métier annoté par des experts du domaine : la performance y est la même, ce qui montre que la méthode généralise au-delà des benchmarks. Une vérification sur votre propre corpus reste possible, sans être nécessaire : cinquante annotations d'un de vos experts suffisent à ce que nous vous rendions le taux d'accord entre lui et nous. Enfin, le livrable n'est pas binaire : chaque chunk porte un degré de pertinence et un indice de fiabilité, et les questions non convergentes sont isolées dans un fichier distinct.
- Une évaluation par modèle de langue n'est-elle pas biaisée ?
Prise naïvement, elle l'est, et c'est documenté. C'est précisément le problème que traite notre protocole — et c'est aussi ce qui fait la valeur du service : si le résultat s'obtenait avec une requête et un modèle, il n'y aurait rien à vendre. Le choix des modèles employés n'est pas ajusté au cas par cas : il vise systématiquement la meilleure qualité disponible, répartie entre plusieurs familles indépendantes, ce qui limite mécaniquement le risque qu'un jugement favorise un système en particulier. Ce que nous exposons, ce sont les effets mesurés : indice de fiabilité, cas litigieux signalés et, si vous le souhaitez, accord avec vos propres experts.
- Combien de questions sont nécessaires ?
Cinquante pour un premier signal. Cent à deux cents pour comparer deux configurations avec un écart interprétable. Cinq cents et au-delà pour segmenter par type de question et localiser les défaillances — c'est généralement là que se trouve l'information utile.
- Nous n'avons pas de questions constituées.
Commencez par vos questions réelles, même en petit nombre : journaux d'utilisation, tickets, demandes de support. Ce sont les meilleures, car les questions produites automatiquement sont systématiquement mieux formées que celles des utilisateurs. À défaut, nous savons en générer en couvrant explicitement plusieurs axes — type de tâche, complexité, style de formulation.
- Que se passe-t-il lorsque le corpus évolue ?
Le référentiel demeure valide pour la partie inchangée. L'actualisation ne retraite que les questions affectées par les chunks modifiés, à demi-tarif.
- Quel format de fichiers ?
Deux fichiers CSV encodés en UTF-8.
questions.csvcomportant les colonnesidetquestion;chunks.csvcomportantid,textet, facultativement,source. En cas de non-conformité, vous recevez dans l'heure le détail des lignes en cause.
Notes
- La proportion de questions signalées est faible en pratique, mais elle n'est pas nulle et nous ne cherchons pas à la masquer : une question ambiguë, ou dont la réponse est absente du corpus, doit être identifiée comme telle plutôt que de recevoir un label arbitraire qui faussera silencieusement vos métriques.
- La couverture du vivier de candidats borne mécaniquement le rappel mesurable : un chunk pertinent absent du vivier n'est pas étiqueté, et ne peut donc pas être compté. C'est la limite structurelle de l'exercice ; elle est affichée dans chaque livraison.
- C'est une limite reconnue de cette famille de méthodes, et non un défaut d'implémentation d'un outil particulier.
- Description fondée sur la documentation publique de chaque outil à la date de rédaction ; ces projets évoluent rapidement.