Benchmark público
Medido con tareas reales de memoria en dos pruebas
Medimos Engram de dos formas: si recupera la evidencia correcta y si un LLM puede responder bien usando ese contexto.
Separamos recuperación de evidencia y precisión de respuesta. Ambas pruebas usan LoCoMo público, pero miden partes distintas del ciclo de memoria.
Recuperación de evidencia LoCoMo
Ejecución pública completa. Las puntuaciones indican si la evidencia necesaria aparece entre las memorias recuperadas.
| Sistema | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5345 | 40.63% | 92.19% | 97.66% |
| LangMem / LangGraph | 0.4002 | 28.32% | 83.98% | 94.53% |
| Mem0 OSS | 0.3999 | 28.32% | 83.92% | 94.27% |
| AgentMemory | 0.4270 | 33.20% | 79.10% | 84.96% |
| BM25 | 0.4676 | 34.57% | 78.19% | 85.74% |
Evaluación de respuesta LoCoMo
Diagnóstico revisado por Codex/self-review sobre las mismas 98 tareas. Mide si la respuesta generada desde el contexto recuperado es correcta.
| Sistema | Respuesta top-50 | Respuesta top-200 | vs modelo base |
|---|---|---|---|
| Engram | 66.33% | 59.18% | +56.13pp |
| Session-file BM25 | 61.22% | 53.06% | +51.02pp |
| Mem0 OSS | 55.10% | 57.14% | +44.90pp |
| BM25 | 48.98% | 44.90% | +38.78pp |
| LangMem / LangGraph | 46.94% | 52.04% | +36.74pp |
| No memory | 10.20% | 9.18% | baseline |
Cómo leer R@200 y Top-200
La recuperación de evidencia es acumulativa: R@200 incluye lo de R@50 y más, así que no debería ser menor. La precisión de respuesta es distinta. Más contexto también puede traer ruido o memorias contradictorias; Top-50 puede responder más limpio y Top-200 prueba si el empaquetado sigue siendo útil con más evidencia.