Scores de précision
La précision mesurée de Cogeto, par version
Cogeto publie sa propre précision mesurée pour chaque version, de la même manière qu'un service publie la disponibilité, y compris les chiffres qui ne répondent pas à ses objectifs. Voici les chiffres, et voici les fichiers de données publics qui les sous-tendent. Ne vous fiez pas à ce tableau : vérifiez le fichier.
L'agrégat combine les corpus de chaque langue. Il est présenté sans masquer une langue moins performante dans une moyenne : utilisez le sélecteur pour consulter chaque langue séparément.
Chaque seuil minimal correspond à la valeur réellement atteinte par la métrique, jamais à un objectif encore hors d'atteinte, et ne peut qu'augmenter. Les seuils s'appliquent à chaque langue et à l'agrégat ; celui affiché dépend donc de la langue sélectionnée.
Scores actuels
Qualité de l'extraction et du rapprochement pour la configuration du modèle et le langage sélectionnés, mesurée par rapport à un corpus doré étiqueté à la main.
| Métrique | Agrégat | Seuil CI |
|---|---|---|
| 84.1% | Seuil CI ≥ 77% Seuil CI: pass | |
| 94.6% | Seuil CI ≥ 91% Seuil CI: pass | |
| 91.9% | Seuil CI ≥ 86% Seuil CI: pass | |
| 94.4% | Seuil CI ≥ 92% Seuil CI: pass | |
| 81.3% | Seuil CI ≥ 54% Seuil CI: pass | |
| 92.9% | Seuil CI ≥ 83% Seuil CI: pass | |
| 66.7%9 paires | Seuil CI ≥ 50% Seuil CI: pass | |
| 90.6% | Seuil CI ≥ 81% Seuil CI: pass |
Suite de discussion
Cas de questions et réponses de bout en bout. Une réussite signifie que la réponse était fondée sur les bons faits du corpus. Les identifiants de cas défaillants sont publiés et non masqués.
32/35cas réussis
Identifiants des cas en échec : atlas_scope, strict_mode_hr, who_is_ana
Évolution
Les dix versions les plus récentes depuis la série v1, de la plus ancienne à la plus récente, sur un axe de 0 à 100 %. L'historique complet reste publié dans le dépôt. La ligne pointillée représente le seuil d'intégration continue qu'une version doit franchir avant publication.
| Version | Précision d'extraction | Rappel d'extraction | Accord de vérification | Précision de la déduplication | Précision des contradictions | Rappel de contradiction | Précision des remplacements | Précision du routage de réécriture des requêtes |
|---|---|---|---|---|---|---|---|---|
| v1.1.0 | 78.9% | 93.3% | 86.5% | 92.9% | non mesuré | 100% | non mesuré | non mesuré |
| v1.2.0 | 79.2% | 91.3% | 89.2% | 92.9% | non mesuré | 100% | non mesuré | non mesuré |
| v1.3.0 | 79.6% | 92% | 86.9% | 92.9% | non mesuré | 100% | non mesuré | non mesuré |
| v1.4.0 | 81.3% | 93.8% | 92.9% | 92.9% | non mesuré | 100% | non mesuré | non mesuré |
| v1.4.1 | 78.9% | 91.1% | 83.3% | 92.9% | 66.7% | 100% | 75% | 90.6% |
| v1.4.2-local | 78.9% | 91.1% | 83.3% | 92.9% | 66.7% | 100% | 75% | 90.6% |
| v1.5.0 | 82.7% | 93.9% | 92.6% | 94.4% | 75% | 100% | 75% | 90.6% |
| v1.6.0 | 82.3% | 90.4% | 91.7% | 94.4% | 82.4% | 100% | 66.7% | 84.4% |
| v1.7.1 | 84.2% | 95.8% | 88.9% | 94.4% | 81.3% | 92.9% | 66.7% | 90.6% |
| v1.8.0 | 84.1% | 94.6% | 91.9% | 94.4% | 81.3% | 92.9% | 66.7% | 90.6% |
Notes des versions
- v1.4.2-localOuvrez le fichier JSON
- Self-hosted configuration measurement (llama.cpp ff711 + bge-m3 on the operator's own hardware), thinking suppressed on every call. Advisory against the Mistral-measured gates: contradiction recall and query-rewrite accuracy sit below their floors; both zero-tolerance gates (injection, subject) pass. Not a release measurement.
Provenance
Chaque version, avec le commit exact auquel elle a été mesurée, la version du harnais, les tailles du corpus et un lien direct vers son fichier JSON immuable. Les fichiers publiés ne sont jamais modifiés après leur publication. Lisez les données, pas notre résumé.
- Harness
- extraction/v0006 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0002 · query_rewrite/v0006 · thresholds v1 + chat answer/v0009 · grader eval-coverage/v0001
- Configuration
mistral-default Models: pipeline
mistral-small-latest, answermistral-medium-latest, embeddingmistral-embedCorpus: 102 golden cases (50 anglais, 52 croate) · 54 reconciliation pairs · 35 chat cases
- Harness
- extraction/v0006 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0002 · query_rewrite/v0006 · thresholds v1 + chat answer/v0009 · grader eval-coverage/v0001
- Configuration
mistral-default Models: pipeline
mistral-small-latest, answermistral-medium-latest, embeddingmistral-embedCorpus: 102 golden cases (50 anglais, 52 croate) · 54 reconciliation pairs · 35 chat cases
- Harness
- extraction/v0006 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0002 · query_rewrite/v0006 · thresholds v1 + chat answer/v0009 · grader eval-coverage/v0001
- Configuration
mistral-default Models: pipeline
mistral-small-latest, answermistral-medium-latest, embeddingmistral-embedCorpus: 102 golden cases (50 anglais, 52 croate) · 54 reconciliation pairs · 35 chat cases
- Harness
- extraction/v0005 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · query_rewrite/v0006 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
- Configuration
mistral-default Models: pipeline
mistral-small-latest, answermistral-medium-latest, embeddingmistral-embedCorpus: 98 golden cases (48 anglais, 50 croate) · 33 reconciliation pairs · 24 chat cases
- Harness
- extraction/v0005 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · query_rewrite/v0006 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
- Configuration
cogeto-offline Models: pipeline
cogeto, answercogeto, embeddingbge-m3Corpus: 98 golden cases (48 anglais, 50 croate) · 33 reconciliation pairs · 24 chat cases
- Configuration
mistral-default Models: pipeline
mistral-small-latest, answermistral-medium-latest, embeddingmistral-embedCorpus: 86 golden cases (42 anglais, 44 croate) · 29 reconciliation pairs · 24 chat cases
- Harness
- extraction/v0004 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · query_rewrite/v0006 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
- Configuration
mistral-default Models: pipeline
mistral-small-latest, answermistral-medium-latest, embeddingmistral-embedCorpus: 86 golden cases (42 anglais, 44 croate) · 29 reconciliation pairs · 24 chat cases
- Harness
- extraction/v0004 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
- Configuration
mistral-default Models: pipeline
mistral-small-latest, answermistral-medium-latest, embeddingmistral-embedCorpus: 86 golden cases (42 anglais, 44 croate) · 20 reconciliation pairs · 24 chat cases
- Harness
- extraction/v0004 + verification/v0006 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
- Configuration
mistral-default Models: pipeline
mistral-small-latest, answermistral-medium-latest, embeddingmistral-embedCorpus: 86 golden cases (42 anglais, 44 croate) · 20 reconciliation pairs · 24 chat cases
- Harness
- extraction/v0002 + verification/v0004 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · thresholds v1 + chat answer/v0007 · grader eval-coverage/v0001
- Configuration
mistral-default Models: pipeline
mistral-small-latest, answermistral-medium-latest, embeddingmistral-embedCorpus: 76 golden cases (37 anglais, 39 croate) · 20 reconciliation pairs · 24 chat cases
- Harness
- extraction/v0002 + verification/v0004 · reconcile_dedup/v0001 + reconcile_contradiction/v0001 · thresholds v1 + chat answer/v0006 · grader eval-coverage/v0001
- Configuration
mistral-default Models: pipeline
mistral-small-latest, answermistral-medium-latest, embeddingmistral-embedCorpus: 76 golden cases (37 anglais, 39 croate) · 20 reconciliation pairs · 27 chat cases