Benchmark público
Medido con tareas reales de memoria en dos pruebas
Medimos Engram de dos formas: si recupera la evidencia correcta y si un LLM puede responder bien usando ese contexto.
Separamos recuperación de evidencia y precisión de respuesta. Ambas pruebas usan LoCoMo público, pero miden partes distintas del ciclo de memoria.
Recuperación de evidencia LoCoMo
Ejecución pública completa. Las puntuaciones indican si la evidencia necesaria aparece entre las memorias recuperadas.
| Sistema | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5427 | 40.95% | 93.29% | 97.59% |
| Mem0 OSS | 0.4314 | 31.25% | 85.16% | 94.79% |
| LangMem / LangGraph | 0.4006 | 28.39% | 83.98% | 94.53% |
| AgentMemory | 0.4627 | 35.68% | 83.33% | N/A |
| Session-file BM25 | 0.1858 | 9.11% | 81.90% | 95.05% |
| BM25 | 0.4676 | 36.39% | 78.19% | 85.74% |
Evaluación de respuesta LoCoMo
Cada fila usa el conjunto completo de 1.536 tareas con evidencia y el mismo límite top-50. Codex generó las respuestas y un evaluador ciego independiente las puntuó. Es un diagnóstico ejecutado por Engram, no una clasificación oficial de LoCoMo.
| Sistema | Correctas / N | Respuesta top-50 |
|---|---|---|
| Engram | 1,377 / 1,536 | 89.65% |
| Mem0 OSS | 1,294 / 1,536 | 84.24% |
| AgentMemory | 1,280 / 1,536 | 83.33% |
| LangMem / LangGraph | 1,279 / 1,536 | 83.27% |
| Session-file BM25 | 1,235 / 1,536 | 80.40% |
| BM25 | 1,227 / 1,536 | 79.88% |
Cómo leer las dos tablas
Las dos evaluaciones publicadas usan las 1.536 tareas con evidencia. La recuperación exige identificadores de fuente y la precisión de respuesta usa los mismos modelos de respuesta y evaluación para cada sistema incluido. Los sistemas que no cumplen el mismo contrato se documentan aparte en lugar de mezclarse en la clasificación.
Cómo leer las dos tablas