| Entailment des Schreib-Gates | AUROC 0.971 | Quelle⊢Fakt, richter-unabhängig (SNLI). Der Burggraben des Schreibpfads. |
| End-to-End-QA · HaluMem, volle Pipeline | 0.66–0.68 | Unsere Extraktion → Gated Store → Antwort: sieben aufeinanderfolgende volle Läufe clustern bei 0.66–0.68 (Mittel 0.667, n=3 sauber) gegenüber MemOS' selbst berichteten 0.672 — Parität, kein Sieg, und so sagen wir es auch. Richter ist Claude, nicht GPT-4; Rohdaten im Repo. |
| Cross-User-Generalisierung | 0.716 | Dasselbe Rezept bei einem nie gesehenen Nutzer (n=169): 0.716. Das Rezept ist nicht auf die Daten eines Nutzers getunt. |
| Memory-Boundary-Abstention | 1.000 × 7 Läufe | Verweigert das Erfinden, wenn der Store eine Antwort nicht stützt — 1.000 über sieben aufeinanderfolgende End-to-End-Läufe. Die Achse, die Wettbewerber nicht messen. |
| Mehrsprachiges Gate-Loch — geschlossen | 8/10 → 0/10 | Aus Live-Tests reproduziert: dieselbe unbelegte Hype-Behauptung passierte das Gate sauber in 8 von 10 Sprachen (der lexikalische Screen war nur EN/IT). Behoben mit einem semantischen Dual-Check, der den mehrsprachigen Embedder selbst als Detektor nutzt, dann gehärtet durch ein adversariales Review, das den ersten „0 FP"-Claim auf Held-out-Sätzen falsifizierte: Fragen, Verneinungen und berichtete Rede werden jetzt per deterministischer Guards ausgeschlossen — by design. Nach dem Fix auf dem echten Write-Path: Hype in 10/10 Sprachen geflaggt, Held-out-Falsch-Positive 0/14 — Kalibrierskript, Review-Findings und Rohdaten im Repo. |
| Auflösung von Gedächtniskonflikten | 0.15 → 0.82 | Ein widersprechendes Update gewinnt nach dem Fix 5,5× häufiger; falsche Rücknahmen von 99 → 7 mit dem Präzisions-Floor (0 Cross-Attribut). Urteil des adversarialen Critic: claim_holds. |
| Halluzinationsrate (ein Regler) | 0.233 → 0.111 | −52% als Schalter (ENGRAM_GROUNDING_GATE), unter Beibehaltung der korrekten Antworten. Du wählst recall-first oder trust-first — bei QA und auf dem Schreibpfad. |
| Retrieval recall@5 · LongMemEval-s | 0.8745 | Vollständige 500, richter-frei, gleicher e5-Embedder, null externe APIs. Fusion ON vs 0.8525 OFF (+2,2 pp). Das ist recall@k, nicht End-to-End-QA-Genauigkeit. |
| Latenz · Nebenläufigkeit | 38ms / 166–237ms | Schreiben 38ms p50 mit vollem Gate; Lesen 166–237ms mit Historie + TrustReport bei 5k Fakten. 500 gleichzeitige Prozesse auf einem SQLite-Store, 0 Fehler (leichte Worker). |
| Test-Suite | 7.761 grün | Selbst ausgeführt, aus dem Repo reproduzierbar. Keine Drittanbieter-Rangliste. Ein Live-Smoke-Test gegen den LLM-Provider ist umgebungsabhängig (gehosteter Provider nötig) und aus der Zählung ausgenommen. |
| TrustMem-Bench · Trust-Achsen | Verimem 60/60 | Unser deterministischer Trust-Benchmark — kein LLM, kein Netz: sechs Achsen, ein Befehl. Verimem schafft 60/60; mem0 OSS deckt 40/60 (0/10 bei Abwesenheit, Vergessen, Herkunft). Eine Raw-Store-Baseline mit Absicht — Wettbewerber sind eingeladen, ihn auszuführen. |
| VeriBench · der Trust-Standard | deterministisch · self-run | Das offene Benchmark für vertrauenswürdige Memory — es misst, was recall@k nicht sieht, denn ein symmetrischer Score unterscheidet keine selbstsichere Falschantwort von einem ehrlichen „Ich weiß es nicht". Auf der kausalen Achse landet ein Trust-only-Store, der eine Scheinkorrelation bestätigt hat, selbst bei λ=1 im Minus (Provenienz ≠ Kausalität). Auf der adversarialen Achse — Kollusion plus vertrauter Sleeper — bleibt nur eine Zwei-Kanal-Policy (unabhängige Bestätigung und Ergebnis) im Plus; jeder Einzelkanal fällt bei einem Angriff. Modellfrei, ein Befehl, Spec im Repo — Wettbewerber sind eingeladen, es auszuführen. Vollständige Ergebnisse, Protokoll und Head-to-Head → |
| Source-Trust auf ECHTEM Korpus | Kartell 0.90 → 0.20 · 3/3 Seeds | HaluEval held-out, Kriterien vor dem ersten Lauf prä-registriert: ein Kartell aus 4 Identitäten, das sich unter naiver ≥2-Quellen-Zählung auf 0.90 selbst bestätigt, wird durch Unabhängigkeit + Audit-Dekonfundierung auf 0.20 zerlegt; ehrliche Quellen steigen auf 0.95, die halluzinierten Antworten des Kartells verschwinden aus dem Recall (→ 0.0). Robustheitskurve (18 Punkte): Falschantworten von Täuschern = 0/18 auf jedem Rauschniveau; der Rest sind ehrliche Ausrutscher — eine Per-Claim-Krankheit, deklariert, nicht versteckt. |
| SLA-Regler · arbeitet am deklarierten Risiko | TCE ≤ 0.011 · Risiko 1,1 % @ 73 % Coverage | Ein starker AUROC sagt, dass Scores diskriminieren; er sagt nicht, dass der λ-Regler am deklarierten Risiko arbeitet (Oxford 2603.21172). Held-out gemessen, Kalibrierung nur auf dev gefittet: rohe Scores ranken fast-orakelhaft (E-AURC 0.0008), versprechen aber ein anderes Risiko als geliefert; nach reiner isotonischer Kalibrierung wird jedes deklarierte λ-Ziel eingehalten — TCE ≤ 0.011 über λ ∈ {0.5–9}, beobachtetes Risiko 1,1 % bei 73 % Coverage. Deklarierter Trade-off: Kalibrierung glättet das feine Ranking — roh zum Ranken, kalibriert zum Betreiben. |