Публичный benchmark
Измерено на реальных задачах памяти двумя проверками
Мы измеряем Engram двумя способами: находит ли он нужное доказательство и может ли LLM правильно ответить по найденному контексту.
Retrieval доказательств и точность ответа разделены. Оба теста используют публичный LoCoMo, но измеряют разные части memory loop.
LoCoMo retrieval доказательств
Полный публичный запуск. Scores показывают, находится ли нужный источник среди retrieved memories.
| Система | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5345 | 40.63% | 92.19% | 97.66% |
| LangMem / LangGraph | 0.4002 | 28.32% | 83.98% | 94.53% |
| Mem0 OSS | 0.3999 | 28.32% | 83.92% | 94.27% |
| AgentMemory | 0.4270 | 33.20% | 79.10% | 84.96% |
| BM25 | 0.4676 | 34.57% | 78.19% | 85.74% |
LoCoMo оценка ответов
Диагностика Codex/self-review на одних и тех же 98 задачах. Оценивает, верен ли ответ, сгенерированный из найденного контекста.
| Система | Ответ top-50 | Ответ top-200 | к базовой модели |
|---|---|---|---|
| Engram | 66.33% | 59.18% | +56.13pp |
| Session-file BM25 | 61.22% | 53.06% | +51.02pp |
| Mem0 OSS | 55.10% | 57.14% | +44.90pp |
| BM25 | 48.98% | 44.90% | +38.78pp |
| LangMem / LangGraph | 46.94% | 52.04% | +36.74pp |
| No memory | 10.20% | 9.18% | baseline |
Как читать R@200 и Top-200
Поиск доказательств кумулятивен: R@200 включает всё из R@50 плюс дополнительные кандидаты, поэтому не должен быть ниже. Точность ответа устроена иначе. Больше контекста может добавить шум или противоречивые memories; Top-50 иногда дает более чистый ответ, а Top-200 проверяет, остается ли упаковка контекста полезной при большем числе доказательств.