Passer au contenu

Scores de précision

La précision mesurée de Cogeto, par version

Version actuelle v1.8.02026-08-16

Cogeto publie sa propre précision mesurée pour chaque version, de la même manière qu'un service publie la disponibilité, y compris les chiffres qui ne répondent pas à ses objectifs. Voici les chiffres, et voici les fichiers de données publics qui les sous-tendent. Ne vous fiez pas à ce tableau : vérifiez le fichier.

Configuration du modèle
Langue
Comparer

L'agrégat combine les corpus de chaque langue. Il est présenté sans masquer une langue moins performante dans une moyenne : utilisez le sélecteur pour consulter chaque langue séparément.

Chaque seuil minimal correspond à la valeur réellement atteinte par la métrique, jamais à un objectif encore hors d'atteinte, et ne peut qu'augmenter. Les seuils s'appliquent à chaque langue et à l'agrégat ; celui affiché dépend donc de la langue sélectionnée.

Scores actuels

Qualité de l'extraction et du rapprochement pour la configuration du modèle et le langage sélectionnés, mesurée par rapport à un corpus doré étiqueté à la main.

Scores for configuration mistral-default, Agrégat, v1.8.0
MétriqueAgrégat
84.1%
94.6%
91.9%
94.4%
81.3%
92.9%
66.7%9 paires
90.6%

Suite de discussion

Cas de questions et réponses de bout en bout. Une réussite signifie que la réponse était fondée sur les bons faits du corpus. Les identifiants de cas défaillants sont publiés et non masqués.

32/35cas réussis

Identifiants des cas en échec : atlas_scope, strict_mode_hr, who_is_ana

Évolution

Les dix versions les plus récentes depuis la série v1, de la plus ancienne à la plus récente, sur un axe de 0 à 100 %. L'historique complet reste publié dans le dépôt. La ligne pointillée représente le seuil d'intégration continue qu'une version doit franchir avant publication.

Mesuré à la versionReconstitué: transcrit à partir d'exécutions enregistrées, plutôt que produit par le banc d'évaluation lors de la publication.Seuil CI
Précision d'extraction84.1%
Rappel d'extraction94.6%
Accord de vérification91.9%
Précision de la déduplication94.4%
Précision des contradictions81.3%
Rappel de contradiction92.9%
Précision des remplacements66.7%
Précision du routage de réécriture des requêtes90.6%
Trend data for configuration mistral-default, Agrégat, all releases
VersionPrécision d'extractionRappel d'extractionAccord de vérificationPrécision de la déduplicationPrécision des contradictionsRappel de contradictionPrécision des remplacementsPrécision du routage de réécriture des requêtes
v1.1.078.9%93.3%86.5%92.9%non mesuré100%non mesurénon mesuré
v1.2.079.2%91.3%89.2%92.9%non mesuré100%non mesurénon mesuré
v1.3.079.6%92%86.9%92.9%non mesuré100%non mesurénon mesuré
v1.4.081.3%93.8%92.9%92.9%non mesuré100%non mesurénon mesuré
v1.4.178.9%91.1%83.3%92.9%66.7%100%75%90.6%
v1.4.2-local78.9%91.1%83.3%92.9%66.7%100%75%90.6%
v1.5.082.7%93.9%92.6%94.4%75%100%75%90.6%
v1.6.082.3%90.4%91.7%94.4%82.4%100%66.7%84.4%
v1.7.184.2%95.8%88.9%94.4%81.3%92.9%66.7%90.6%
v1.8.084.1%94.6%91.9%94.4%81.3%92.9%66.7%90.6%

Notes des versions

  • v1.4.2-localOuvrez le fichier JSON
    • Self-hosted configuration measurement (llama.cpp ff711 + bge-m3 on the operator's own hardware), thinking suppressed on every call. Advisory against the Mistral-measured gates: contradiction recall and query-rewrite accuracy sit below their floors; both zero-tolerance gates (injection, subject) pass. Not a release measurement.

Provenance

Chaque version, avec le commit exact auquel elle a été mesurée, la version du harnais, les tailles du corpus et un lien direct vers son fichier JSON immuable. Les fichiers publiés ne sont jamais modifiés après leur publication. Lisez les données, pas notre résumé.

  • Harness
    extraction/v0006 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0002 · query_rewrite/v0006 · thresholds v1 + chat answer/v0009 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 102 golden cases (50 anglais, 52 croate) · 54 reconciliation pairs · 35 chat cases

  • Harness
    extraction/v0006 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0002 · query_rewrite/v0006 · thresholds v1 + chat answer/v0009 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 102 golden cases (50 anglais, 52 croate) · 54 reconciliation pairs · 35 chat cases

  • Harness
    extraction/v0006 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0002 · query_rewrite/v0006 · thresholds v1 + chat answer/v0009 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 102 golden cases (50 anglais, 52 croate) · 54 reconciliation pairs · 35 chat cases

  • Harness
    extraction/v0005 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · query_rewrite/v0006 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 98 golden cases (48 anglais, 50 croate) · 33 reconciliation pairs · 24 chat cases

  • v1.4.2-local2026-08-05Ouvrez le fichier JSONbe2254dc6e
    Harness
    extraction/v0005 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · query_rewrite/v0006 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
    Configuration cogeto-offline

    Models: pipeline cogeto, answer cogeto, embedding bge-m3

    Corpus: 98 golden cases (48 anglais, 50 croate) · 33 reconciliation pairs · 24 chat cases

    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 86 golden cases (42 anglais, 44 croate) · 29 reconciliation pairs · 24 chat cases

  • Harness
    extraction/v0004 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · query_rewrite/v0006 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 86 golden cases (42 anglais, 44 croate) · 29 reconciliation pairs · 24 chat cases

  • Harness
    extraction/v0004 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 86 golden cases (42 anglais, 44 croate) · 20 reconciliation pairs · 24 chat cases

  • Harness
    extraction/v0004 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 86 golden cases (42 anglais, 44 croate) · 20 reconciliation pairs · 24 chat cases

  • Harness
    extraction/v0002 + verification/v0004 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 76 golden cases (37 anglais, 39 croate) · 20 reconciliation pairs · 24 chat cases

  • Harness
    extraction/v0002 + verification/v0004 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · thresholds v1 + chat answer/v0006 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 76 golden cases (37 anglais, 39 croate) · 20 reconciliation pairs · 27 chat cases

Retour à cogeto.eu