Passer au contenu

Scores de précision

La précision mesurée de Cogeto, par version

Version actuelle v1.19.02026-09-03

Cogeto publie sa propre précision mesurée pour chaque version, de la même manière qu'un service publie la disponibilité, y compris les chiffres qui ne répondent pas à ses objectifs. Les chiffres sont lus directement dans les fichiers de données par version au moment de la construction, y compris ceux qui sont partis dans le mauvais sens.

Configuration du modèle
Langue
Comparer

L'agrégat combine les corpus de chaque langue. Il est présenté sans masquer une langue moins performante dans une moyenne : utilisez le sélecteur pour consulter chaque langue séparément.

Chaque seuil minimal correspond à la valeur réellement atteinte par la métrique, jamais à un objectif encore hors d'atteinte, et ne peut qu'augmenter. Les seuils s'appliquent à chaque langue et à l'agrégat ; celui affiché dépend donc de la langue sélectionnée.

cogeto-default est mesurée dans 1 des 10 versions chargées, pour la première fois dans v1.19.0.

Scores actuels

Qualité de l'extraction et du rapprochement pour la configuration du modèle et le langage sélectionnés, mesurée par rapport à un corpus doré étiqueté à la main.

Scores for configuration cogeto-default, Agrégat, v1.19.0
MétriqueAgrégat
97.7%
100%
100%
100%
95.5%
100%
77.6%9 paires
100%

Suite de discussion

Cas de questions et réponses de bout en bout. Une réussite signifie que la réponse était fondée sur les bons faits du corpus. Les identifiants de cas défaillants sont publiés et non masqués.

32/35cas réussis

Identifiants des cas en échec : changed_since, strict_mode_hr, who_is_ana

Évolution

Les dix versions les plus récentes depuis la série v1, de la plus ancienne à la plus récente, sur un axe de 0 à 100 %. L'historique complet est conservé, et chaque version reste immuable une fois publiée. La ligne pointillée représente le seuil d'intégration continue qu'une version doit franchir avant publication.

Mesuré à la versionReconstitué: transcrit à partir d'exécutions enregistrées, plutôt que produit par le banc d'évaluation lors de la publication.Seuil CI
Précision d'extraction97.7%
Rappel d'extraction100%
Accord de vérification100%
Précision de la déduplication100%
Précision des contradictions95.5%
Rappel de contradiction100%
Précision des remplacements77.6%
Précision du routage de réécriture des requêtes100%
Trend data for configuration cogeto-default, Agrégat, all releases
VersionPrécision d'extractionRappel d'extractionAccord de vérificationPrécision de la déduplicationPrécision des contradictionsRappel de contradictionPrécision des remplacementsPrécision du routage de réécriture des requêtes
v1.3.0non mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesuré
v1.4.0non mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesuré
v1.4.1non mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesuré
v1.4.2-localnon mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesuré
v1.5.0non mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesuré
v1.6.0non mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesuré
v1.7.1non mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesuré
v1.8.0non mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesuré
v1.9.0non mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesurénon mesuré
v1.19.097.7%100%100%100%95.5%100%77.6%100%

Notes des versions

  • v1.4.2-local
    • Self-hosted configuration measurement (llama.cpp ff711 + bge-m3 on the operator's own hardware), thinking suppressed on every call. Advisory against the Mistral-measured gates: contradiction recall and query-rewrite accuracy sit below their floors; both zero-tolerance gates (injection, subject) pass. Not a release measurement.

Provenance

Chaque version, avec le commit exact auquel elle a été mesurée, la version du harnais et les tailles du corpus. Les fichiers publiés ne sont jamais modifiés après leur publication : un chiffre affiché ici remonte toujours à l'arbre sur lequel il a été mesuré.

  • v1.19.02026-09-03b4fc62ca6c
    Harness
    extraction/v0006 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0002 · query_rewrite/v0006 · thresholds v1 + chat answer/v0009 · grader eval-coverage/v0001
    Configuration cogeto-default

    Models: pipeline cogeto-core, answer cogeto-fast, embedding cogeto-embed

    Corpus: 102 golden cases (50 anglais, 52 croate) · 54 reconciliation pairs · 35 chat cases

  • v1.9.02026-08-201c6a5990c0
    Harness
    extraction/v0006 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0002 · query_rewrite/v0006 · thresholds v1 + chat answer/v0009 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 102 golden cases (50 anglais, 52 croate) · 54 reconciliation pairs · 35 chat cases

  • v1.8.02026-08-164e9e590862
    Harness
    extraction/v0006 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0002 · query_rewrite/v0006 · thresholds v1 + chat answer/v0009 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 102 golden cases (50 anglais, 52 croate) · 54 reconciliation pairs · 35 chat cases

  • v1.7.12026-08-1467f8e10bba
    Harness
    extraction/v0006 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0002 · query_rewrite/v0006 · thresholds v1 + chat answer/v0009 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 102 golden cases (50 anglais, 52 croate) · 54 reconciliation pairs · 35 chat cases

  • v1.6.02026-08-12ffa3e4b27b
    Harness
    extraction/v0006 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0002 · query_rewrite/v0006 · thresholds v1 + chat answer/v0009 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 102 golden cases (50 anglais, 52 croate) · 54 reconciliation pairs · 35 chat cases

  • v1.5.02026-08-050c5f8cc1a2
    Harness
    extraction/v0005 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · query_rewrite/v0006 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 98 golden cases (48 anglais, 50 croate) · 33 reconciliation pairs · 24 chat cases

  • v1.4.2-local2026-08-05be2254dc6e
    Harness
    extraction/v0005 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · query_rewrite/v0006 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
    Configuration cogeto-offline

    Models: pipeline cogeto, answer cogeto, embedding bge-m3

    Corpus: 98 golden cases (48 anglais, 50 croate) · 33 reconciliation pairs · 24 chat cases

    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 86 golden cases (42 anglais, 44 croate) · 29 reconciliation pairs · 24 chat cases

  • v1.4.12026-08-0130d97a1007
    Harness
    extraction/v0004 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · query_rewrite/v0006 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 86 golden cases (42 anglais, 44 croate) · 29 reconciliation pairs · 24 chat cases

  • v1.4.02026-07-31eca1222b3b
    Harness
    extraction/v0004 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 86 golden cases (42 anglais, 44 croate) · 20 reconciliation pairs · 24 chat cases

  • v1.3.02026-07-305bf26124c0
    Harness
    extraction/v0004 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
    Configuration mistral-default

    Models: pipeline mistral-small-latest, answer mistral-medium-latest, embedding mistral-embed

    Corpus: 86 golden cases (42 anglais, 44 croate) · 20 reconciliation pairs · 24 chat cases

Retour à cogeto.eu