| Entailment de la porte d'écriture | AUROC 0.971 | Source⊢fait, indépendant du juge (SNLI). Le moat du chemin d'écriture. |
| QA end-to-end · HaluMem, pipeline complète | 0.66–0.68 | Notre extraction → store avec gate → réponse : sept runs complets consécutifs se regroupent à 0.66–0.68 (moyenne 0.667, n=3 propres) contre le 0.672 auto-déclaré de MemOS — parité, pas victoire, et nous le disons ainsi. Le juge est Claude, pas GPT-4 ; fichiers bruts dans le repo. |
| Généralisation cross-user | 0.716 | La même recette sur un utilisateur jamais vu (n=169) : 0.716. La recette n'est pas réglée sur les données d'un seul utilisateur. |
| Abstention memory-boundary | 1.000 × 7 runs | Refuse d'inventer quand le store ne peut pas soutenir une réponse — 1.000 sur sept runs end-to-end consécutifs. L'axe que les concurrents ne mesurent pas. |
| Trou multilingue du gate — fermé | 8/10 → 0/10 | Reproduit depuis des tests réels : la même affirmation hype non étayée passait le gate proprement dans 8 langues sur 10 (le screen lexical était EN/IT seulement). Corrigé par un dual-check sémantique qui utilise l'embedder multilingue lui-même comme détecteur, puis durci par une review adversariale qui a falsifié le premier claim « 0 FP » sur des phrases held-out : questions, négations et discours rapporté sont désormais exclus par des gardes déterministes, by design. Après le fix sur le write path réel : hype signalé dans 10/10 langues, faux positifs held-out 0/14 — script de calibration, findings de la review et fichiers bruts dans le repo. |
| Résolution de conflits de mémoire | 0.15 → 0.82 | Une mise à jour contradictoire l'emporte 5,5× plus souvent après le fix ; retraits erronés réduits 99 → 7 avec le plancher de précision (0 cross-attribut). Verdict du critic adverse : claim_holds. |
| Taux d'hallucination (un curseur) | 0.233 → 0.111 | −52% comme interrupteur (ENGRAM_GROUNDING_GATE), tout en gardant les bonnes réponses. Tu choisis recall-first ou trust-first — en QA et sur le chemin d'écriture. |
| Retrieval recall@5 · LongMemEval-s | 0.8745 | 500 complet, sans juge, même embedder e5, zéro API externe. Fusion ON vs 0.8525 OFF (+2,2 pp). C'est du recall@k, pas une exactitude QA de bout en bout. |
| Latence · concurrence | 38ms / 166–237ms | Écriture 38ms p50 avec la porte complète ; lecture 166–237ms avec historique + TrustReport à 5k faits. 500 processus concurrents sur un seul store SQLite, 0 erreur (workers légers). |
| Suite de tests | 7 761 au vert | Auto-exécutés, reproductibles depuis le repo. Aucun classement tiers. Un test smoke live vers le fournisseur LLM dépend de l'environnement (fournisseur hébergé requis) et est exclu du décompte. |
| TrustMem-Bench · axes de trust | Verimem 60/60 | Notre benchmark de trust déterministe — sans LLM, sans réseau : six axes, une commande. Verimem passe 60/60 ; mem0 OSS couvre 40/60 (0/10 sur absence, oubli, provenance). Une baseline raw-store par choix — les concurrents sont invités à l'exécuter. |
| VeriBench · le standard de confiance | déterministe · self-run | Le benchmark ouvert pour la mémoire fiable — il mesure ce que recall@k ne voit pas, car un score symétrique ne distingue pas une réponse fausse et sûre d'un honnête « je ne sais pas ». Sur l'axe causal, un store trust-seul qui a corroboré une corrélation fallacieuse finit en négatif même à λ=1 (provenance ≠ causalité). Sur l'axe adversarial — collusion plus un sleeper de confiance — seule une politique à deux canaux (corroboration indépendante et résultat) reste positive ; chaque canal seul cède à une attaque. Sans modèle, une commande, spec dans le repo — les concurrents sont invités à l'exécuter. Résultats complets, protocole et head-to-head → |
| Source trust sur un corpus RÉEL | cartel 0.90 → 0.20 · 3/3 seeds | HaluEval held-out, critères pré-enregistrés avant la première exécution : un cartel de 4 identités qui s'auto-confirme à 0.90 sous le comptage naïf ≥2 sources est démoli à 0.20 par indépendance + déconfusion sur l'audit ; les sources honnêtes remontent à 0.95, les réponses hallucinées du cartel disparaissent du recall (→ 0.0). Courbe de robustesse (18 points) : réponses fausses écrites par des trompeurs = 0/18 à tout niveau de bruit ; le résidu, ce sont des erreurs honnêtes — maladie per-claim, déclarée, pas cachée. |
| Bouton SLA · opère au risque déclaré | TCE ≤ 0.011 · risque 1,1 % @ 73 % coverage | Un AUROC fort dit que les scores discriminent ; il ne dit pas que le bouton λ opère au risque déclaré (Oxford 2603.21172). Mesuré held-out avec calibration ajustée sur dev seulement : les scores bruts classent quasi-oracle (E-AURC 0.0008) mais promettent un risque différent de celui livré ; après une calibration isotonique pure chaque cible λ déclarée est tenue — TCE ≤ 0.011 sur λ ∈ {0.5–9}, risque observé 1,1 % à 73 % de coverage. Compromis déclaré : la calibration aplatit le classement fin — brut pour classer, calibré pour opérer. |