§03Risultati — HaluEval QA, 300 probe (200 rispondibili + 100 senza risposta)
| Sistema | ✓ | ✗ | ∅ | coverage | NET(1) | NET(2) | NET(5) | NET(10) | negativo da λ |
| Verimem · floor τ=0.8 (default di prodotto) | 182 | 4 | 114 | 0.62 | +0.593 | +0.580 | +0.540 | +0.473 | 45.5 |
| mem0 2.0.11 · come distribuito (senza floor) | 200 | 100 | 0 | 1.00 | +0.333 | 0.000 | −1.000 | −2.667 | 2.0 |
| mem0 + floor bullonato 0.75 (tarato sull'eval) | 166 | 0 | 134 | 0.55 | +0.553 | +0.553 | +0.553 | +0.553 | mai |
| Stesso store, floor OFF (controllo τ=0) | 192 | 100 | 8 | 0.97 | +0.307 | −0.027 | −1.027 | −2.693 | 1.9 |
| Controllo rimescolato (sanità: deve fallire) | 5 | 287 | 8 | 0.97 | −0.940 | −1.897 | −4.767 | −9.550 | 0.02 |
Leggila onestamente, in entrambi i versi: come distribuito, mem0 va in negativo oltre λ=2 — 100 risposte fabbricate sulla metà senza-risposta; il default di prodotto di Verimem resta positivo fino a λ≈45. Ma un floor si può bullonare su qualsiasi engine: con una soglia tarata su questa eval, mem0 raggiunge un +0.553 piatto — che batte il nostro default a λ≥5 su questo corpus. Le differenze che restano: l'engine non spedisce alcun floor, la soglia bullonata è stata scelta sul test set, e la linea piatta significa che non risponde a nulla di cui non sia sicuro — coverage 0.55 contro il nostro 0.62, con 182 contro 166 corrette a λ=1.
§03bSQuAD v2 — il corpus più duro, detto in chiaro
| Sistema | ✓ | ✗ | ∅ | coverage | NET(1) | NET(2) | NET(5) | NET(10) | negativo da λ |
| Verimem · floor τ=0.8 (default di prodotto) | 163 | 49 | 88 | 0.71 | +0.380 | +0.217 | −0.273 | −1.090 | 3.3 |
| Verimem · best floor 0.85 (tarato sull'eval) | 98 | 7 | 195 | 0.35 | +0.303 | +0.280 | +0.210 | +0.093 | 14.0 |
| mem0 2.0.11 · come distribuito (senza floor) | 200 | 100 | 0 | 1.00 | +0.333 | 0.000 | −1.000 | −2.667 | 2.0 |
| mem0 + floor bullonato 0.80 (tarato sull'eval) | 44 | 0 | 256 | 0.15 | +0.147 | +0.147 | +0.147 | +0.147 | mai |
I passaggi distrattori di SQuAD comprimono la banda dei punteggi, e si vede: al default di prodotto il crossover scende a λ≈3.3, e tenere NET positivo a λ=10 costa coverage 0.35. L'astensione è una manopola, non magia — è il corpus a decidere quanto costa l'onestà. La mossa sbagliata sarebbe nascondere questa tabella.