§03Résultats — HaluEval QA, 300 sondes (200 répondables + 100 sans réponse)
| Système | ✓ | ✗ | ∅ | coverage | NET(1) | NET(2) | NET(5) | NET(10) | négatif à partir de λ |
| Verimem · plancher τ=0.8 (défaut produit) | 182 | 4 | 114 | 0.62 | +0.593 | +0.580 | +0.540 | +0.473 | 45.5 |
| mem0 2.0.11 · tel que livré (sans plancher) | 200 | 100 | 0 | 1.00 | +0.333 | 0.000 | −1.000 | −2.667 | 2.0 |
| mem0 + plancher boulonné 0.75 (réglé sur l'éval) | 166 | 0 | 134 | 0.55 | +0.553 | +0.553 | +0.553 | +0.553 | jamais |
| Même store, plancher OFF (contrôle τ=0) | 192 | 100 | 8 | 0.97 | +0.307 | −0.027 | −1.027 | −2.693 | 1.9 |
| Contrôle mélangé (sanité : doit échouer) | 5 | 287 | 8 | 0.97 | −0.940 | −1.897 | −4.767 | −9.550 | 0.02 |
Lisez-la honnêtement, dans les deux sens : tel que livré, mem0 passe en négatif au-delà de λ=2 — 100 réponses fabriquées sur la moitié sans-réponse ; le défaut produit de Verimem reste positif jusqu'à λ≈45. Mais un plancher peut se boulonner sur n'importe quel moteur : avec un seuil réglé sur cette éval, mem0 atteint un +0.553 plat — qui bat notre défaut à λ≥5 sur ce corpus. Les différences qui restent : le moteur ne livre aucun plancher, le seuil boulonné a été choisi sur le test set, et la ligne plate signifie qu'il ne répond à rien dont il n'est pas sûr — coverage 0.55 contre notre 0.62, avec 182 contre 166 correctes à λ=1.
§03bSQuAD v2 — le corpus plus dur, dit franchement
| Système | ✓ | ✗ | ∅ | coverage | NET(1) | NET(2) | NET(5) | NET(10) | négatif à partir de λ |
| Verimem · plancher τ=0.8 (défaut produit) | 163 | 49 | 88 | 0.71 | +0.380 | +0.217 | −0.273 | −1.090 | 3.3 |
| Verimem · meilleur plancher 0.85 (réglé sur l'éval) | 98 | 7 | 195 | 0.35 | +0.303 | +0.280 | +0.210 | +0.093 | 14.0 |
| mem0 2.0.11 · tel que livré (sans plancher) | 200 | 100 | 0 | 1.00 | +0.333 | 0.000 | −1.000 | −2.667 | 2.0 |
| mem0 + plancher boulonné 0.80 (réglé sur l'éval) | 44 | 0 | 256 | 0.15 | +0.147 | +0.147 | +0.147 | +0.147 | jamais |
Les passages distracteurs de SQuAD compressent la bande de scores, et ça se voit : au défaut produit le crossover tombe à λ≈3.3, et tenir NET positif à λ=10 coûte une coverage de 0.35. L'abstention est un bouton, pas de la magie — c'est le corpus qui décide combien coûte l'honnêteté. La mauvaise décision serait de cacher ce tableau.