§03Resultados — HaluEval QA, 300 pruebas (200 respondibles + 100 sin respuesta)
| Sistema | ✓ | ✗ | ∅ | coverage | NET(1) | NET(2) | NET(5) | NET(10) | negativo desde λ |
| Verimem · floor τ=0.8 (default de producto) | 182 | 4 | 114 | 0.62 | +0.593 | +0.580 | +0.540 | +0.473 | 45.5 |
| mem0 2.0.11 · tal como se distribuye (sin floor) | 200 | 100 | 0 | 1.00 | +0.333 | 0.000 | −1.000 | −2.667 | 2.0 |
| mem0 + floor atornillado 0.75 (ajustado en la eval) | 166 | 0 | 134 | 0.55 | +0.553 | +0.553 | +0.553 | +0.553 | nunca |
| Mismo store, floor OFF (control τ=0) | 192 | 100 | 8 | 0.97 | +0.307 | −0.027 | −1.027 | −2.693 | 1.9 |
| Control barajado (sanidad: debe fallar) | 5 | 287 | 8 | 0.97 | −0.940 | −1.897 | −4.767 | −9.550 | 0.02 |
Léela honestamente, en ambos sentidos: tal como se distribuye, mem0 pasa a negativo más allá de λ=2 — 100 respuestas fabricadas en la mitad sin-respuesta; el default de producto de Verimem sigue positivo hasta λ≈45. Pero un floor puede atornillarse a cualquier motor: con un umbral ajustado en esta eval, mem0 alcanza un +0.553 plano — que supera a nuestro default en λ≥5 en este corpus. Las diferencias que quedan: el motor no incluye ningún floor, el umbral atornillado se eligió en el test set, y la línea plana significa que no responde nada de lo que no esté seguro — coverage 0.55 frente a nuestro 0.62, con 182 frente a 166 correctas en λ=1.
§03bSQuAD v2 — el corpus más duro, dicho claramente
| Sistema | ✓ | ✗ | ∅ | coverage | NET(1) | NET(2) | NET(5) | NET(10) | negativo desde λ |
| Verimem · floor τ=0.8 (default de producto) | 163 | 49 | 88 | 0.71 | +0.380 | +0.217 | −0.273 | −1.090 | 3.3 |
| Verimem · mejor floor 0.85 (ajustado en la eval) | 98 | 7 | 195 | 0.35 | +0.303 | +0.280 | +0.210 | +0.093 | 14.0 |
| mem0 2.0.11 · tal como se distribuye (sin floor) | 200 | 100 | 0 | 1.00 | +0.333 | 0.000 | −1.000 | −2.667 | 2.0 |
| mem0 + floor atornillado 0.80 (ajustado en la eval) | 44 | 0 | 256 | 0.15 | +0.147 | +0.147 | +0.147 | +0.147 | nunca |
Los pasajes distractores de SQuAD comprimen la banda de puntuaciones, y se nota: en el default de producto el crossover baja a λ≈3.3, y mantener NET positivo en λ=10 cuesta coverage 0.35. La abstención es una perilla, no magia — el corpus decide cuánto cuesta la honestidad. Lo incorrecto sería esconder esta tabla.